跳转至

FOCUS.md — 当前关注摘要

只记录阶段性关注、判断和问题意识;不罗列所有学过的论文。

当前关注

  • verifier / ORM:关注从被动打分到 critique、step-level verification、agentic evidence generation、continuous verifier score 的演进。(260712-260712)
  • agentic verification for coding and long-horizon tasks:关注 verifier 如何主动构造反例、查证证据、选择候选轨迹,而不是只做 judge。(260712-260712)
  • 可编辑创作 agent:关注长期用户偏好、会话工作记忆、工具执行记忆如何支持多轮局部修改且减少漂移。(260712-260712)
  • 实时多模态 social world model:关注生成模型从离线 clip 走向流式、低延迟、可交互的音视频社交系统。(260712-260712)
  • agentic RL 优化:关注异步 rollout 的 policy lag、single-rollout critic、observation-aware advantage estimation 与长轨迹训练稳定性。(260713-260713)
  • reasoning state 安全:关注加密 thinking state 的客户端携带、跨会话重放、状态注入、日志泄漏与长度/时延侧信道。(260715-260715)
  • 高难数学 benchmark 设计:关注原创未公开题、防污染、自动验证、专家审核与研究级难度之间的取舍。(260716-260716)

已形成判断

  • 困难任务里的 verifier 瓶颈正在从“检查多少次”转向“能否提出高信息量检查”。(260712-260712)
  • 强 generator 的错误更隐蔽,hard negatives 和 targeted counterexamples 比显然错误样本更有训练价值。(260712-260712)
  • reward / verifier 数据质量、prompt 内 pair 构造、偏差过滤和污染检查,通常比单纯扩大数据规模更关键。(260712-260712)
  • 对复杂 agent 轨迹,粗粒度 pass/fail 或 1-5 judge 分数会丢掉大量区分信号;连续分数、criteria decomposition 和 repeated evaluation 更适合作为 test-time selection 信号。(260712-260712)
  • FrontierMath 这类 benchmark 短期更适合作为能力上限探针,而不是模型细粒度排序工具;低于 2% 的解题率会让单次成功对排名产生过大影响。(260716-260716)
  • 长时程 Agent 的异步 RL 不只是 scheduler/throughput 问题;sampling unit、behavior log-prob、critic 跟踪速度和 action/observation 边界会直接决定优化是否稳定。(260713-260713)
  • thinking signature 是可被服务端解密和重放的敏感模型状态;Open Reasoning 初版的 harvest/retry/alignment 线索进一步表明其更像“重放后由模型复述并评分”,而非客户端持钥解密。(260715-260715)
  • 已用 claude-sonnet-5 独立复现 Open Reasoning 的 signature 重放恢复:BYOK 助记→signature→重放 thinking:""+sig 即可跨会话恢复 secret(N=12,短 secret 12/12 确定性命中,长 CoT 12/12 非确定);篡改 signature 被服务端拒绝。置信度从 0.85 升为已复现。(260715-260715)
  • signature 重放能否落地由模型安全策略决定:sonnet-5 配合重建(alignment≈1.0),fable-5 拒绝(BYOK 藏 secret 与 hidden reasoning 复述均 refusal,连 signature 都不产生)。作者所谓"Fable 5 未完成"实为模型 refusal 阻断,非解密难题。(260715-260715)

待继续追问

  • verifier scaling 的边界在哪里:何时增加 verifier compute 会接近 oracle Pass@N,何时只是放大 judge 偏差?(260712-260712)
  • agentic verifier 的训练信号应如何从 reranking 扩展到 policy learning,同时避免 reward hacking 和错误证据循环?(260712-260712)
  • social world model 的 benchmark 如何同时衡量实时性、交互一致性、音视频同步、身份安全和滥用风险?(260712-260712)