外观
Reasoning Structure (2026) - 大模型推理结构论文详解
约 1836 字大约 6 分钟
论文Reasoning Structure推理模型大语言模型
论文基本信息
- 标题: Reasoning Structure of Large Language Models
- 作者: Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam, Roger Wattenhofer
- 年份: 2026
- 发表: ICML 2026
- 论文链接: arXiv论文
- arXiv编号: 2606.03883
为什么值得读
推理模型火起来以后,常见评估方式仍然很粗:看最终答案是否正确,或者看模型用了多少 token。这篇论文指出一个关键问题:两个模型即使最终正确率相同、推理长度相近,也可能使用完全不同的推理结构。
这对理解 DeepSeek-R1 这类推理模型很重要。R1 证明了强化学习可以激发更强推理能力,但我们还需要回答另一个问题:模型到底是如何推理的?它是在集中地沿着关键依赖推进,还是在绕圈、试探、重复和自我修补?
这篇论文的价值就在这里:它把非结构化的推理文本转换成可验证的推理图,用图结构分析推理路径。
核心贡献
- 把推理轨迹变成图:将模型输出中的 claim 和依赖关系抽取成 reasoning graph。
- 提出结构化评估视角:不只看答案是否正确,也分析推理的拓扑结构。
- 构造逻辑谜题基准:用可验证的逻辑谜题来观察不同模型的推理过程。
- 提出推理效率指标:衡量模型逻辑流是否集中,避免只用 token 数粗略估计推理成本。
- 揭示指标盲区:说明 accuracy 和 token count 会混淆不同的推理行为。
问题背景
当前推理模型评估大致有三种常见口径:
| 评估口径 | 优点 | 问题 |
|---|---|---|
| 最终答案正确率 | 简单、可比较 | 看不出推理过程质量 |
| token 数 | 能估算推理成本 | 长不等于深,短不等于高效 |
| 人工阅读推理链 | 细致、直观 | 成本高,不可规模化 |
论文认为,推理过程本身应该被结构化测量。一个模型可能用很少 token 直接跳到答案,也可能用很多 token 做无效尝试;只看长度和答案,会错过这些差异。
方法直觉
论文的核心流程可以拆成四步:
- 收集推理轨迹:让模型回答逻辑谜题,并保留完整推理文本。
- 抽取 claims:把推理文本拆成一组可检查的中间断言。
- 建立依赖关系:判断哪些断言依赖哪些前置断言。
- 形成推理图:把 claim 当作节点,把依赖关系当作边。
这样一来,原本难以比较的自然语言推理,就变成了可以分析的图。
推理图怎么看
一个简化的推理图可以这样理解:
| 图元素 | 含义 |
|---|---|
| 节点 | 模型提出的中间 claim |
| 边 | 一个 claim 对另一个 claim 的依赖 |
| 路径 | 从题目信息到最终答案的逻辑链 |
| 分支 | 模型同时探索的多个可能方向 |
| 回环/重复 | 可能代表模型绕圈或反复修补 |
如果推理图高度分散,说明模型可能在多条路线之间试探;如果推理图集中但依赖错误,说明模型可能快速走向错误结论;如果推理图集中且关键依赖正确,通常代表更有效的推理。
推理效率
论文提出的推理效率思想,可以理解为:不要只问模型花了多少 token,而要问这些 token 是否形成了有用的逻辑结构。
例如两个模型都用了 1000 个 token:
- 模型 A 的推理图围绕少数关键 claim 展开,依赖关系清晰。
- 模型 B 的推理图分散、重复、分支很多,最后碰巧得到正确答案。
传统 token 统计会把它们看成成本相近;结构化评估会认为 A 的推理更集中、更可诊断。
与 DeepSeek-R1 的关系
DeepSeek-R1 关注的是“怎么训练出推理能力”,这篇论文关注的是“怎么测量推理结构”。两者可以形成互补:
| 问题 | 代表论文 | 关注点 |
|---|---|---|
| 推理能力如何被激发 | DeepSeek-R1 | 结果奖励、强化学习、推理涌现 |
| 推理过程如何被分析 | Reasoning Structure | claim、依赖关系、推理图、结构指标 |
如果把 R1 类模型看成推理能力的训练突破,那么这篇论文更像是评估工具的补课:模型变强之后,我们需要更细的尺子。
实践启发
1. 评估推理模型不能只看最终答案
在业务场景中,一个模型给出正确答案不代表过程可靠。对于法律、医学、金融、复杂代码修改等任务,中间依据是否可靠同样重要。
2. 推理链需要可解析
如果模型输出完全自由散漫,就很难抽取 claim 和依赖关系。因此在提示词或后训练中约束推理结构,本身也会提升可观测性。
3. 图结构可以帮助定位失败
一旦推理被转换成图,就可以追踪错误传播:
- 哪个 claim 首先错了?
- 错误 claim 影响了哪些后续判断?
- 模型是否在错误路径上越走越远?
- 模型是否有自我修正能力?
这些问题比“答案错了”更有诊断价值。
可以怎么落地
如果要把这篇论文的思想用到自己的 Agent 或 RAG 系统里,可以从简化版开始:
- 要求模型输出分步骤 claim。
- 每个 claim 标注依据:来自题目、检索文档、工具结果还是前置推理。
- 用规则或另一个模型检查 claim 之间的依赖。
- 把最终答案关联回关键 claim。
- 对失败案例分析最早出错的节点。
这不一定要一开始就实现完整图算法。只要能把推理过程从“长文本”变成“有依赖关系的步骤”,可调试性就会提升很多。
局限性
- 抽取 claim 本身可能出错:如果解析器或辅助模型理解错了推理文本,图结构也会失真。
- 逻辑谜题不等于真实任务:真实业务中的证据、工具和环境更复杂。
- 结构好不一定事实对:推理图清晰但前提错误,仍然会得到错误答案。
- 评估成本更高:比单纯跑 accuracy 复杂,需要额外抽取和验证流程。
- 开放任务更难标准化:写作、策略、产品分析等任务很难定义唯一推理图。
一句话总结
Reasoning Structure of Large Language Models 的核心意义是:它把大模型推理从“看答案和长度”推进到“分析推理结构”,为 2026 年推理模型评估提供了一把更细的尺子。
资源链接
更新日志
2026/7/24 14:15
查看所有更新日志
1a4c1-docs: 更新论文板块与更新日志于
版权所有
版权归属:huanghx02