transcript.segments.jsonl3,288 字符
ASR 提醒机器转写可能有专名、数字与断句误差,请结合原视频复核。
{"chunk_index": 0, "start_seconds": 0, "timestamp": "00:00:00", "text": "今天聊一篇很有冲击力的论文,LLMs Get Lost in Multi-Turn Conversation。它研究的现象很具体,用户越补充需求,模型有时不是更清楚,反而越来越难回到正确答案。这听起来像日常使用里的痛点,论文的核心判断是什么?核心不是大模型不会做这些任务,而是同一个任务如果从一次性完整说明改成多轮逐步补充,模型的稳定性会明显下降。论文把这个现象叫做 Lost in Conversation。这篇论文来自哪里?它是不是只看了某个小实验?作者来自 Microsoft Research 和 Salesforce Research,论文在2025年五月发布到 arXiv。它不是小样本观察,而是覆盖六类生成任务,15个模型,20万次以上模拟对话的大规模评测。为什么传统 benchmark 看不出这个问题?因为传统评测通常是单轮完整指令,题目一开始就把背景、目标、约束全交给模型,但真实用户往往先说一个模糊需求,然后随着对话继续,一点点补充条件。所以论文不是在换任务,而是在换信息到达方式。对,作者尽量让底层任务保持一致,只改变信息是一次性到达还是分多轮到达,这样才能判断退化到底来自任务难度,还是来自多轮欠说明本身。他们具体怎么把单轮任务变成多轮对话?方法叫 Sharding,可以理解为切片,先从 Human Eval、Spider、GSM 八 k 等已有数据集里取完整题目,再把题目拆成若干互不重叠的信息片段,第一片只给高层意图,后面每片补一个约束。拆完以后怎么保证没有丢信息?论文用了半自动流程,先由大模型做分割和口语化重写,再做覆盖验证,确认所有切片合在一起能表达原题信息。也就是说,多轮版本不是少给了条件,而是把条件分散到不同轮次。模拟对话时,用户和模型分别知道什么?被测助手只看当前对话历史,用户模拟器知道完整切片列表,但每轮最多透露一个切片,裁判系统会判断助手是在澄清、讨论,还是已经给出最终答案,如果是最终答案就抽取并评分。论文里 Full、Concat、Sharded 这三个设置怎么区分?Full 是原始完整题目,一轮发给模型,Concat 是把切片拼起来,也是一轮发给模型,Sharded 才是逐轮透露切片,Concat 很关键,因为它能排除切片改写导致信息损失这个解释。结果到底掉了多少?在六类任务上,Shard、Sharded 相对 Full 平均下降39%,而 Concat 平均能保持 Full 的95.1%,这说明问题主要不是切片内容本身,而是信息被分散在多轮之后,模型处理路径变得不稳定。强模型也这样吗?还是小模型拖了平均值?强模型也会,论文测试了 G P T 四 o、G P T 4.1、Claude 3.7、Sonnet、Gemini 2.5 Pro、DeepSeek R 一、O 三等模型,单轮越强的模型,多轮下也仍然会显著退化。那是不是模型真的变笨了?论文最有价值的地方就在这里,作者把平均表现拆成两个角度,Aptitude 也就是最好情况下的能力上限,Unreliability 也就是同一任务最好轨迹和最差轨迹之间的差距。这两个指标怎么理解?不用公式说一遍。可以想象同一个需求让模型重复做10次,Aptitude 看的是高分那几次,说明模型在理想轨迹下能不能做出来,Unreliability 看的是高分和低分差多远,差越大说明同样问题越像抽签。拆完之后结论是什么?从单轮到多轮,Aptitude 平均只下降约16%,但 Unreliability 增加约112%,所以模型不是完全失去知识,而是有时能做对,有时彻底跑偏,稳定性突然变差。它为什么会跑偏?第一步错了就改不回来吗?论文的分析支持这个方向,模型常在信息不足时过早给完整答案,于是把自己脑补的假设写进上下文,后面用户补充新条件时,模型往往沿着旧答案修补,而不是重新建立问题。有没有数据能说明过早作答真的有害?有,在代码和数学任务上,第一次答案尝试越晚,平均分越高。", "text_length": 1643, "provider": "dashscope", "model": "qwen3-asr-flash", "language": "zh", "source_media": "media://bilibili-bv1j9r2bne7i/video.mp4", "source_audio": "media://bilibili-bv1j9r2bne7i/asr-chunks/chunk-000.mp3"}
{"chunk_index": 1, "start_seconds": 300, "timestamp": "00:05:00", "text": "前2%10对话就尝试完整作答的平均分是30.9,等到最后20%才作答,平均分是64.4。这和我们平时看到的越改越长有关吗?有关,论文把它叫 answer bloat,也就是答案膨胀。多轮里模型会不断在旧答案上加补丁,最终答案比单轮版本长20~300%,这通常意味着方案更复杂,也更容易夹带旧错误。还有别的失效模式吗?还有一个叫 loss in middle turns,摘要任务里模型更容易引用第一轮和最后一轮的信息,中间轮次更容易被忽略。也就是说,长上下文里的中间遗忘在多轮对话里也会出现。如果把 temperature 调到零,会不会稳定很多?单轮会好很多,但多轮不够。论文在 gpt 四 o 和 gpt 四 o mini 上做了温度实验,full 和 concat 的不可靠性会明显下降,但 shared 中改善很有限,即使用户模拟器和助手都设为零,仍有大约30的不可靠性。那用 agent 框架把历史信息重复一遍呢?论文试了两种近似策略,而 recap 是最后补一轮汇总所有用户信息,as no bill bill 是每轮重复之前已经透露的信息,它们能缓解一部分,但仍然追不上 full 或 concat。这说明什么?说明仅靠外部流程把信息再喂一遍,不能完全替代模型自身的多轮可靠性。工程上可以做上下文整理,但论文的判断是模型本身也需要被优化为更可靠的多轮交互者。给用户的实际建议是什么?如果一个对话已经明显跑偏,继续补充不一定划算,更稳的做法是让模型先整理目前所有需求,然后把整理后的完整指令放进新对话,这和 concat 的结果是一致的。这篇论文的边界在哪里?第一,用户是大模型模拟的,不是真人。第二,任务主要是英文文本和分析型生成任务,不覆盖创意写作、多语言、多模态。第三,sharing 对话比较理想化,真实用户可能更混乱。那它的结论会不会被夸大?作者反而认为可能低估了真实退化,因为模拟里最后一定会给足信息,用户也不会彻底跑题,真实产品里还有误解、放弃、目标不可行等情况,可能让多轮可靠性更难。你怎么评价这篇论文最重要的贡献?我的理解是它把模型越聊越乱,从体验抱怨变成了可测量问题,尤其是 aptitude 和 unreliability 的拆分,让我们看到模型不只是要更聪明,还要在不完整信息下更稳定。最后用一句话总结,听众应该记住什么?这篇论文提醒我们,大模型的下一步进步不只是在单轮题目上拿更高分,还要在真实对话里少脑补,稳定论,并且能从早期错误里真正恢复。", "text_length": 1041, "provider": "dashscope", "model": "qwen3-asr-flash", "language": "zh", "source_media": "media://bilibili-bv1j9r2bne7i/video.mp4", "source_audio": "media://bilibili-bv1j9r2bne7i/asr-chunks/chunk-001.mp3"}