AI聊天机器人越聊越“笨”?可能真不是错觉_对话_模型_DeepSeek

不知道大家有没有这种感觉:和AI机器人短时间聊天的话还行,时间一长,就感觉对话开始变的前言不搭后语、逻辑不通。
其实这种感觉并不是错觉。
最近,微软发表的一项研究证实,即使是目前最先进的大语言模型,在多轮对话中的可靠性也会急剧下降。
研究人员对包括 GPT-4.1、Gemini 2.5 Pro、Claude 3.7 Sonnet、o3、DeepSeek R1 和 Llama 4 在内的 15 款顶尖模型进行了超过 20 万次模拟对话分析,揭示出一个被称为“迷失会话”的系统性缺陷。
数据显示,这些模型在单次提示任务中的成功率可达 90%,但当同样的任务被拆解成多轮自然对话后,成功率骤降至约 65%。
研究指出,模型的核心能力仅降低约 15%,但“不可靠性”却飙升 112%。
也就是说,AI 大模型仍然具备解决问题的能力,但在多轮对话中变得高度不稳定,难以持续跟踪上下文。
研究人员进一步分析了造成性能下降的行为机制。
首先是“过早生成”。模型在用户尚未完整说明需求前就尝试给出最终答案。一旦在早期回合中形成错误***设,模型后续便会在该错误的基础上继续推理,而不是随着新信息的加入进行修正,从而导致错误逐步放大。
其次是“答案膨胀”。在多轮对话中,模型的回复长度比单轮对话增加了 20% 至 300%。更长的回答往往包含更多***设与“幻觉”,这些内容随后被纳入对话的持续上下文,从而进一步影响后续推理的准确性。
令人意外的是,即使是配备了额外“思考词元”(thinking tokens)的新一代推理模型,如 OpenAI o3 和 DeepSeek R1,也未能显著改善在多轮对话中的表现。
研究人员指出,现有的基准测试主要基于理想的单轮场景,忽略了模型在真实世界中的行为。
因此,对于那些依赖 AI 构建复杂对话流程或智能体的开发者而言,这一结论意味着未来将要接受严峻挑战。
再来看看其他消息。
微软日前测试 Windows 11新版“画图”(Paint)应用,重点引入“自由旋转”功能。
根据微软官方描述,用户现在可以全方位角度调整形状、文本框以及任何活动的图像选区。用户选中对象后,其上方会出现一个“旋转手柄”,用户只需拖动该手柄即可向任意方向自由旋转对象,从而实现更自然的构图和布局。
除了直观的手动拖拽,微软还为需要高精度编辑的用户提供了解决方案。在“旋转”菜单下新增了“自定义旋转”选项,用户可以在此输入具体的角度数值,实现精确到 1 度的微调。返回搜狐,查看更多
-
{dede:pagebreak/}


下一篇 : 马斯克xAI雪崩!24小时两联创离职,一月内连失三位华人创始人,12人梦之队只剩一半_吴宇怀_Grok_Jimmy
网友评论:

- 刚刚!AI大牛股,重磅发布!四大创新来袭,多家国产芯片“入列”_智谱_模型_编程
- 马云“腊八之约”畅谈AI,阿里狂甩“连炸”_教育_乡村_时代
- 刚刚,又一位xAI华人离职!曾和马斯克并排坐发Grok 3_吴宇怀_团队_来源
- 2026 年最「不是人」的一届春晚_机器人_刘谦_宇树
- 一箭七星!海上发射,成功_捷龙_运载火箭_卫星
- 阿里向“token巨兽”举起了核电之矛_建设_能源_电力
- 丁磊回归一线,网易稳住了“江山”_游戏_丁迎峰_包括
- 狂砸4万亿!美国四巨头“流血”搞AI,苹果:溜了溜了_支出_总资本_Meta
- 从蔡明扮机器人,到机器人陪蔡明,春晚走了30年_宇树_科技_中国
- 雷军:个别车商为蹭流量说小米二手车崩盘,实际上我们排在第一位_保值_直播_年度

- 卷入爱泼斯坦案,马斯克回应_特朗普_凯文·沃什_美国
- 烧了540亿,机器人进入“吃鸡游戏”拐点_企业_春晚_玩家
- 十公里之隔,黄仁勋的中国棋局生变_天数_性能_架构
- 大批企业开始逃离光伏!麦迪科技、华东重机等企业撤出,谁在抄底谁在割肉?_产能_行业_资产
- AI空调卷疯了!格力、美的、海尔集体押注,核心价值是「省钱省电」?_温度_Star_传统
- 为何俄罗斯不担心芯片、光刻机断供?除了中国,其他国家都不担心_产业链_技术_工业
- 深夜偷看“成人网站”,还以为没人知道?你可能被安排得明明白白_内容_用户_访问
- 特斯拉转型,“擎天柱链”倚重中国?马斯克:未来营收规模或可达10万亿美元_机器人_人形_零部件
- 为什么我们科技水平超前了,消费却一直跟不上?_房地产_信心_姚洋
- 2026手机熄火,联发科、高通的“新饭碗”_内存_市场_安蒙


