跳转至

Encrypted Reasoning State:签名、重放与推理隐私

主题定位

推理模型 API 会把隐藏 reasoning/thinking 作为加密状态交给客户端保存,并在后续请求中回传。这是 agent 多轮推理、工具调用连续性、无状态 API 和 ZDR 设计之间的系统交点,同时引入重放、状态注入、隐私泄漏和侧信道问题。

当前结论

  • Claude thinking.signature 包含加密的完整 thinking,而不是单纯的验签值。
  • 客户端原样回传 block 后,Anthropic 服务端会验证、解密并为 prompt construction 重建原 thinking。
  • 公开独立实验显示未修改的 reasoning block 可能跨 session/账号重放,并对后续模型产生语义作用。
  • 因此 signature 应被当作敏感、可重放的客户端携带状态,而不是可随意记录的 telemetry。
  • “从 signature 找回随机 canary”能证明加密状态具有语义恢复能力,但不能单独证明客户端已破解密钥或逐字恢复完整原始 CoT。
  • 即使获得 raw thinking,它也不是模型决策的完备因果解释;faithfulness 仍需独立验证。

工程问题

  • 是否应在应用层把 reasoning state 绑定到账号、session、model 和 TTL?
  • provider 是否使用过宽的全局密钥或验证域,导致跨租户重放?
  • agent transcript、observability、debug bundle 和训练数据是否意外收集 signature?
  • reasoning length、token count、latency 等侧信道能泄露多少 secret-dependent computation?
  • context compaction 应保留、丢弃还是重新封装 encrypted reasoning state?

安全基线

  • 不公开或跨信任域共享 signature / redacted thinking data。
  • 只回传 provider 原样生成的完整 block,拒绝用户构造的 message JSON 注入。
  • 对客户端保存的 reasoning state 做访问控制、TTL、日志脱敏和会话绑定。
  • 只用合成 canary 做研究,不把真实 secret 放进隐藏 thinking。
  • 区分语义重放、内容恢复、逐字恢复和独立密码学解密四种不同强度的主张。

已学习资料