ASR EVIDENCE PACKAGE

ICLR26 Best Paper:多轮对话一旦走错,Agent为什么很难回头?上下文污染让模型迷失

多轮对话的主要风险不一定是模型“不会做”,而是信息逐轮到达时,模型过早作答、把未经确认的假设写入上下文,随后围绕旧答案打补丁,导致同一任务的结果变得不稳定;当对话已经跑偏时,整理完整规格并在干净的新上下文中重开,通常比继续堆历史更稳。

打开原始来源 ↗在 GitHub 查看目录 ↗
内容摘要查看源文件

多轮对话中的上下文污染:视频总结

来源:哔哩哔哩视频(短链:b23.tv/tZfCnb6)。视频时长约 494.7 秒,已用 Qwen3-ASR-Flash 分成 2 段保存全文 ASR。逐字稿见 transcript.txt,带分段元数据的 JSONL 见 transcript.segments.jsonl

一句话结论

多轮对话的主要风险不一定是模型“不会做”,而是信息逐轮到达时,模型过早作答、把未经确认的假设写入上下文,随后围绕旧答案打补丁,导致同一任务的结果变得不稳定;当对话已经跑偏时,整理完整规格并在干净的新上下文中重开,通常比继续堆历史更稳。

视频讲了什么

视频解读论文 “LLMs Get Lost in Multi-Turn Conversation”(视觉笔记中标题略有不同,论文身份与视频标题中的“ICLR26 Best Paper”均尚未独立核验)。论文把同一任务设置成三种信息到达方式:

  1. Full:完整需求一次性输入。
  2. Concat:把切片后的全部信息拼接后一次性输入,用来排除“切片本身丢信息”的解释。
  3. Sharded:每轮最多透露一个信息片段,模拟真实用户逐步补充背景与约束。

视频口播称,实验覆盖六类生成任务、15 个模型和 20 万次以上模拟对话;Sharded 相对 Full 平均下降约 39%,而 Concat 保持 Full 结果的约 95.1%。这组数字是视频转述,需以论文原文核对。

核心发现

  • 能力上限没有完全消失,可靠性却明显下降。 视频用 Aptitude 表示最好轨迹能做到什么,用 Unreliability 表示同一任务最好与最差轨迹的差距;口播称多轮下 Aptitude 约下降 16%,Unreliability 约上升 112%。
  • 过早提交完整答案会污染后续上下文。 模型在信息尚不完整时脑补前提,并把它写进回答;后续约束到达后,常见行为是修补旧答案,而不是从问题定义重新建模。
  • 等待更多信息再作答更有利。 视频称在代码与数学任务中,前 20% 对话内就尝试完整作答的平均分约为 30.9,最后 20% 才作答约为 64.4。
  • 答案会膨胀。 多轮最终回答可能比单轮版本长 20%–300%,新增内容不一定代表更完整,可能只是旧错误和补丁的累积。
  • 中间轮容易被忽略。 摘要任务更容易引用第一轮和最后一轮,中间轮约束可能丢失。
  • 低温度不是充分修复。 Temperature=0 对 Full/Concat 有帮助,但对 Sharded 的不可靠性改善有限;recap 或逐轮重复旧信息也只能部分缓解。

上下文污染的机制

信息不完整
  → 过早给出完整答案
  → 未确认假设进入历史
  → 新约束被解释为“给旧答案打补丁”
  → 答案膨胀 / 中间约束遗漏 / 轨迹分叉
  → 即使后来信息齐全,也难以回到正确解

这解释了视频中的关键判断:“模型不是完全失去知识,而是有时能做对,有时彻底跑偏。”

可复用的 Agent 方法论

1. 延迟承诺

在目标、输入、约束或验收标准尚未齐全时,先输出“已确认事实、未知项、假设和澄清问题”,不要提交伪完整方案。

2. 建立约束账本

每轮将信息分为:用户确认事实、约束、待确认项、模型假设,并记录来源轮次。重点检查中间轮,而不是只看首轮和最后一轮。

3. 触发式重建

当新条件推翻早期前提、答案持续变长、旧错误反复出现或中间约束缺失时,废弃失效假设,生成一份自洽的完整规格,在新上下文重新执行。视频给用户的直接建议是:“继续补充不一定划算。”

4. 把可靠性纳入评测

除平均分和最好结果,还应记录:跨运行最好/最差差距、首次完整作答时机、约束遗漏率、答案长度增长、中间轮覆盖率,以及从错误状态恢复所需的轮数。

5. 为 Agent 增加回答闸门

只有在关键规格满足时才允许“最终答案”;否则保持澄清或条件化草案状态。重开对话时携带的应是完整规格,而不是未经清洗的旧聊天记录。

适合直接复用的提示片段

  • “先不要给最终方案。请列出已确认事实、约束、未知项和需要澄清的问题。”
  • “把整段对话压缩为一份自洽规格;删除已失效假设,并标注每项约束来自哪一轮。”
  • “检查当前方案是否仍依赖被后续消息推翻的前提;若有,请从问题定义开始重建。”
  • “逐项核对所有中间轮约束,不要只依据首轮目标和最后一条消息。”

证据边界

完整 ASR 和语义分析保存在本目录;分析依据见 semantic-analysis.mdvisual-notes.md。视频中的论文标题、作者/机构、ICLR26 获奖状态、模型清单及所有精确数字均应视为视频口播主张,在论文原文、arXiv 元数据和官方会议记录核验前,不应作为已证实事实对外引用。实验主要是英文文本任务和 LLM 模拟用户,不能直接外推到真人、多语言、多模态或所有 Agent 工作流。

Agent 资产候选

本视频最适合沉淀为四类工具:多轮需求规格整理器、上下文污染检测器、澄清优先执行器、对话重启交接器。它们应消费本目录的分段 ASR 和结构化语义,而不是只消费最终摘要。