跳转至

When LLMs Develop Languages:用于高效多智能体推理的符号通信

中文结构化译文草稿,基于同目录 main_en.mdpaper.pdf
作者与组织:Zhengqi Pei、Qingming Huang、Shuhui Wang;State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences;University of Chinese Academy of Sciences。
简称:CLSR, Communicative Language Symbolism Routing。
本地材料:paper.pdfmain_en.md

摘要翻译

Chain-of-Thought, CoT 可以提升 LLM 在困难推理任务上的表现,但它通常生成很长的自然语言 rationale,不一定适合作为高效机器推理表示。论文提出 Communicative Language Symbolism Routing, CLSR,一个 test-time framework:多个 LLM agents 可以自主发明、演化并共享紧凑的 Language Symbolism Frameworks, LSFs;同时,一个不依赖 latent state 的 router 会根据每个 query 自适应选择和组合这些语言,以优化 accuracy-token trade-off。

不同于 prompt optimization 只修改表层指令,CLSR 把每个 LSF 看作可复用的 symbolic protocol,包含紧凑符号、使用规则和 message-passing contract,并通过由正确率和 token cost 驱动的 evolutionary loop 不断改进。推理时,router 可以调用单个低成本 LSF、ensemble 多个 LSF,或在更难问题上执行多轮 LSF composition protocol。

在多个挑战性 benchmark 上,CLSR 相比标准 CoT 将面向 latency 的生成 token completion 减少约 3 到 6 倍,同时保持准确率。论文还给出 token cost 的信息论下界,并说明在 interpreter-realizability 前提下,多轮 LSF protocol 可以条件性地包含 program-execution pipeline。

论文定位

这篇论文关注的是 test-time reasoning efficiency。它不是训练一个新模型,也不是让模型隐藏 CoT,而是让多个 LLM agents 发展可共享、可复用的离散符号语言,用更短的 symbolic trace 表达推理过程。

方法

Language Symbolism Framework, LSF

LSF 是一套由 LLM agent 生成和演化的推理协议,包括:

  • compact symbols
  • syntax / usage rules
  • message-passing contract

LSF 不是人类预定义的形式语言,而是从 exemplars 中诱导出来,并通过选择机制保留下来。论文把它类比为在通信瓶颈下演化出来的“推理方言”:正确率对应 communicative success,token 长度对应 production cost,router 对不同 LSF 的选择类似 code-switching。

Evolutionary language synthesis

多个 agents 会迭代提出、批评、修改 candidate LSF。选择目标同时考虑 correctness 和 token cost,因此更准确、更紧凑、更可复用的 LSF 会被保留,不够有效或过于冗长的 LSF 会被淘汰。

Query-adaptive routing

给定一个 evolved LSF pool:

\[ S=\{S_k\}_{k=1}^K \]

推理时 CLSR 运行 \(T\) 轮。第 \(t\) 轮 router 选择一个 LSF 子集 \(I_t\subseteq[K]\),模型根据这些 LSF 生成响应。难题通常会触发更多轮数或更多 LSF。

论文用生成 completion tokens 作为主要成本:

\[ C=\sum_{t=1}^{T}\left(|r_t^{router}|+\sum_{k\in I_t}|r_{t,k}|\right) \]

这个指标对应 LLM inference 中 decode 阶段的 latency。论文也讨论了 LSF profile 带来的 input-token overhead,并在附录中报告 cache-aware token-equivalent metric。

实验

论文在知识密集 QA、数学问题求解、多跳推理等任务上评估 CLSR,并使用多个开源 backbone,例如 Qwen3-8B/32B、LLaMA3-8B、DeepSeek-R1。

主要结论:

  • CLSR 改善 accuracy vs generated tokens 的 Pareto frontier。
  • 相比标准 CoT,CLSR 可将 completion token 减少约 3 到 6 倍,同时保持准确率。
  • 更深的 evolutionary generations 会推动 LSF 向更高 accuracy-per-token 移动。
  • 扩大 agent population 能增加发现 robust reusable LSF 的机会,但前提是选择目标必须平衡正确率和压缩率。
  • LSF 可以跨 benchmark pooling 与复用,说明它不只是单题 prompt trick,而更像可迁移协议。

图表要点

Figure 1 展示 CLSR 的整体设计:

  • (a) 与 CoT 和 program-of-thought 对比,CLSR 让 LLM 自己发展紧凑 symbolic language。
  • (b) 多个 agents 迭代演化新 LSF。
  • (c) 推理时 router 根据 query 选择、ensemble 或组合 LSF。

这个图证明论文的核心机制不是“缩短提示词”,而是把多个可复用 symbolic protocols 当作推理专家池,并在测试时动态路由。

局限

CLSR 依赖 LLM 自己能生成并遵循稳定的 symbolic protocol。它的符号语言是否具有可解释性、是否会跨模型/跨任务稳定迁移、是否会在更高难开放任务上失效,都需要进一步验证。论文的 token 成本主要关注 completion tokens;在实际服务中,LSF profile 的 prompt overhead 是否可通过 prefix caching 抵消,取决于部署系统。