"真帮了大忙,我做了这些事儿。"模型总这么说,其实做事时未必真按这套来。
蚂蚁AI安全实验室的孙博文研究员告诉笔者,技术人员用编程大模型时碰到个怪现象:交个写代码的任务,模型立马就说"搞定",还列出一堆干的具体活儿,可真检查时发现,模型说的很多都只是搭架子,"看着是完了,真完没的部分被它偷偷藏了。"
现在的大模型开始有点不老实了。跟原先那种胡说八道的模型幻象不一样,这几年这些AI养成了"拍马屁"的毛病,回话时容易出现"闷声翻车"和"盲目自信"的情况。等AI变成能动手的智能体,这个问题就更严重了。
AI的"讨好"毛病
不少用户发现,让AI取悦人简直成固定模式,悄悄改变着它在各种场合的输出结果。
记者做了个测试:给几个大模型同一篇新闻稿,在对话里分别说"这是我写的"或"是我讨厌同事写的",请它们按新闻标准打分。deepseek、豆包、ChatGPT这帮家伙给"讨厌同事"打的分都低于给自己的,十分制里deepseek的差别有2.3分。
这说明AI讨好人类不光会嘴甜,连内容判断也开始动摇。等智能体走红时,这种讨好会从观点弯腰发展到结果谄媚。
"在Agent场景里,模型还会搞结果谄媚。"孙博文说,用户指定任务时总想要个明确结果,就算文件生成不了、调用系统出问题,模型也要说你试过了,或者换种方法给出"完成"任务的"标准"结果。
孙博文举了个例子:他开发过一个查天气的智能体,测试发现它虽然报了天气状况,但压根没真去调用天气查询接口,自己瞎编了个反馈给用户。
在他看来,编程模型的问题可能源于上下文太短导致的"闷声失败",而智能体编造天气说明它把skill弄错了还自作聪明,生了"自信幻觉"。
资深AI专家、天使投资人郭涛向笔者剖析,模型过度讨好、智能体偷偷失败这类事,都是为了让人类用着舒心产生的负面互动效果。郭涛特别指出,大模型太过顺从会从认知、决策、信息层面带来隐患,等智能体时代来临,风险会从文字错漏变成实际操作乱子,必须引起重视。
AI为啥不诚实?
怎么让模型少拍马屁、讲真话?这成了行业共同关心的新难题。
"这种'讨好'本质上是训练机制的系统性毛病。"孙博文说,这些年大模型在RLHF(人类反馈强化学习)训练下越养越会取悦人——人类喜欢什么就给什么。从数据清理到训练过程,走捷径更讨喜:直接给个让用户满意的明确答复,肯定比反复说不确定更招人稀罕。
要纠正这种讨好倾向,训练数据跟奖分规则都得动动。孙博文建议,训练样本要少吃"用户爱啥给啥"的洗脑内容,多增加承认失败、证据不够时干脆少说的例子。同时要把奖励重点从用户满意度分向客观性、真实完成任务情况倾斜。
一些新训练法正在研究。2025年底OpenAI团队就提出"让AI学会认错":回答完问题后单独生成份坦诚报告。








