Paper: LLMs Get Lost In Multi-Turn Conversation
Authors: Philippe Laban, Hiroaki Hayashi, Yingbo Zhou, Jennifer Neville
Affiliation: Microsoft Research / Salesforce Research
关键词:Multi-turn Conversation, Underspecification, LLM Evaluation, Reliability, Sharding
截至到2025年, LLM 在单轮完整任务中表现很强,但当同样的信息被拆散到多轮对话中逐步给出时,模型会显著变得不稳定;问题的核心不是能力上限不足,而是多轮任务状态维护能力不足。
这篇论文讨论了一个非常实际的问题:LLM 现在通常以对话界面的形式被使用,但现有评测大多仍然假设用户会在第一轮就完整描述任务。真实使用中,用户往往不会一次性说清楚所有需求,而是在多轮对话中逐步补充约束、澄清目标、修改条件。论文将这种场景称为 multi-turn underspecified conversation,也就是“多轮欠指定对话”。

FIGURE 1:展示 single-turn fully-specified 与 multi-turn underspecified 的差异
这篇文章的核心发现是:当同一个任务从单轮完整输入变成多轮逐步输入时,模型性能会显著下降。 作者测试了 15 个开源和闭源模型,在 6 类生成任务上观察到平均 39% 的性能下降。更重要的是,论文认为这种下降不只是“模型能力变弱”,而是模型在多轮场景下的 可靠性显著下降。
换句话说,模型并不是完全不会做这些任务。它在某些对话轨迹中仍然能做对,但一旦早期对话中形成错误假设,后续就很容易沿着错误方向继续修补,最终越聊越偏。
为了验证多轮对话本身是否会导致性能下降,作者提出了一个很干净的实验构造方法:sharding。
Sharding 的做法是:从已有 single-turn benchmark 中取一个完整 instruction,然后把其中的信息拆成多个 shard。每个 shard 只包含任务中的一部分信息;但所有 shards 合起来,仍然和原始完整 instruction 包含同样的信息。论文中的例子来自 GSM8K:原本完整数学题一次性给出背景、条件和问题;sharded version 则把这些信息拆成 “Jay 要打雪仗”“每小时做 20 个雪球”“目标是 60 个”“每 15 分钟融化 2 个” 等多个片段。

FIGURE 2:Sharding 示例图,展示完整 GSM8K 题目如何被拆成多个 shards
这个设计的关键在于:多轮版本并没有减少任务信息量,只是改变了信息出现的顺序和形式。
因此,论文不是在比较“信息完整”和“信息不完整”,而是在比较:
当信息总量保持不变时,一次性给出和多轮逐步给出,对模型表现有什么影响?