待学习队列¶
记录用户感兴趣但尚未正式学习的论文、博客、仓库和技术报告。一旦开始学习或分析某条目,就从这里删除。
| 论文 / 资料 | 链接 / ID | 兴趣点 | 本地 PDF | 记录时间 |
|---|---|---|---|---|
| LoRA Without Regret | https://thinkingmachines.ai/blog/lora/#how-much-capacity-is-needed-by-supervised-and-reinforcement-learning | Thinking Machines Lab;LoRA vs full fine-tuning;SFT/RL 所需容量;post-training 参数效率 | N/A | 260712 |
| On-Policy Distillation | https://thinkingmachines.ai/blog/on-policy-distillation/ | Thinking Machines Lab;on-policy distillation;结合 on-policy 采样与 dense teacher feedback;reasoning 与 personalization 后训练 | N/A | 260712 |
| Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit | https://arxiv.org/abs/2606.20711 | 唐杰团队;UI 视频生成交互式网页;action-aware revisit;状态转移对齐 | N/A | 260712 |
| Show HN:如何在低配置电脑上运行 GLM-5.2 / JustVugg colibri | https://github.com/JustVugg/colibri | GLM-5.2 低内存本地推理;C 实现;专家从磁盘流式加载 | N/A | 260712 |
| 2x GH200 for LLM inference, Part 3: GLM-5.2, expert offload, and the CPU question | https://dnhkng.github.io/posts/gh200-benchmarking-part-3-glm52/ | GLM-5.2 在双 GH200 上的推理、expert offload、CPU/内存带宽与 MTP 权衡 | N/A | 260712 |
| IdeaBench: Benchmarking Large Language Models for Research Idea Generation | https://arxiv.org/abs/2411.02429 | research idea generation benchmark;基于论文 title/abstract/reference context 评估 LLM 科研想法生成;novelty/feasibility 等指标 | N/A | 260712 |
| LiveIdeaBench: Evaluating LLMs' Scientific Creativity and Idea Generation with Minimal Context | https://liveideabench.com/ | scientific creativity / idea generation benchmark;single-keyword prompts;originality、feasibility、fluency、flexibility、clarity | N/A | 260712 |
| CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents | https://arxiv.org/abs/2607.05378 | 长时程 agent;上下文压缩;任务执行与摘要生成联合优化;token-level loss normalization;cross-trajectory GAE | N/A | 260713 |
| FireAct: Toward Language Agent Fine-tuning | https://arxiv.org/abs/2310.05915 | language agent fine-tuning;多任务、多 prompting method 的 agent trajectories;泛化、鲁棒性、效率与成本 | N/A | 260724 |
| TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling | https://arxiv.org/abs/2508.17445 | DPWriter 引用的分支/分叉策略;tree-based 启发式建模;策略优化与推理效率 | N/A | 260727 |
| Segment Policy Optimization (SPO) | https://arxiv.org/abs/2505.23564 | DPWriter 引用的分支策略;segment-level credit assignment;RL for LLMs | N/A | 260727 |
| First Return, Entropy-Eliciting Explore | https://arxiv.org/abs/2507.07017 | DPWriter 引用的分支/探索策略;first-return + entropy-eliciting exploration;rollout 多样性 | N/A | 260727 |
| NoveltyBench: Evaluating Language Models for Humanlike Diversity | https://arxiv.org/abs/2504.05228 | 多样性评测基准;DPWriter 与 Darling 共用的 Distinct 指标来源;用二分类器把输出划语义等价类、数类数(id/标题经 DPWriter、Darling 两篇引用互证,arXiv API 本次限流未直查) | N/A | 260727 |
专题:错误定位后局部重新 rollout¶
260728 宽口径检索。目标范式:检查模型输出或 Agent 轨迹,定位逻辑错误、动作错误或指令违反出现的位置,保留此前正确前缀,并从错误点重新 rollout;训练时尽量只更新分叉后的部分。
最接近¶
| 论文 | 简单描述 | 与目标范式的关系 | 本地 PDF | 记录时间 |
|---|---|---|---|---|
| Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs(ERL;ICLR 2026 Poster) | 用分解、检索和子答案的过程奖励识别错误步骤,擦除对应 action unit,截断到最近正确状态后原地重生成。 | 直接实现“识别错误—保留前缀—局部重生成”;目前主要面向多跳搜索。 | N/A | 260728 |
| R³L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification | 根据错误信息、执行轨迹和环境反馈生成结构化反思,定位错误首次出现的 pivot turn,从该处带纠错指导重新生成,并只优化分叉后缀。 | 与目标的通用自然语言表述最接近;覆盖数学推理和 Agent 任务。 | N/A | 260728 |
| Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry(PivoARL) | 自反思输出最早错误 turn 和改进 remark,环境回放到该状态,仅重做错误 turn 之后的轨迹,并隔离错误后缀的 credit。 | 完整实现 Agent RL 中的“reflect → locate → local retry”。 | N/A | 260728 |
| STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning | 联合训练 generator 和 generative verifier;verifier 用逐步语言反馈定位 First Point of Failure,再从一个或多个已验证前缀锚点重定向 rollout。 | 同时包含学习式错误检查、局部重生成和 RL;当前以数学、逻辑和代码推理为主。 | N/A | 260728 |
| Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning(ELPO) | 固定候选前缀并多次采样后缀,用二分 rollout tree 找到第一个不可恢复步骤,再做局部 advantage attribution 和针对性更新。 | 通过反事实可恢复性而非一次语言判断定位错误;更接近因果定位,但采样成本更高。 | N/A | 260728 |
| Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs(E³RL) | 用模型自身局部交叉熵和动态阈值检测异常 segment,删除局部缺陷、复用此前 KV cache 并重新生成。 | 具备 segment 级擦除和重 rollout;以不确定性代理逻辑错误,不依赖外部 verifier。 | N/A | 260728 |
相关但不完全符合¶
| 论文 | 简单描述 | 不完全符合之处 | 本地 PDF | 记录时间 |
|---|---|---|---|---|
| Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning(VPPO;Findings of ACL 2026) | 用 PRM 定位第一个错误,将失败轨迹拆成 verified good prefix 和错误后缀,只惩罚错误之后的部分。 | 定位结果主要用于 credit assignment,没有从错误点生成修复后缀。 | N/A | 260728 |
| InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning | 模型借助参考解定位首个错误、提出单步 intervention,并从修正处生成反事实 continuation;随后用这些 intervention 做 SFT,再继续 RL。 | 有局部修复和续写,但核心训练信号是 intervention SFT,不是直接的局部 rollout RL。 | N/A | 260728 |
| Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning | 首次失败后生成自反思,再把反思放入上下文完整重试;若第二次成功,就奖励反思 token。 | 使用 RL 学会反思,但没有定位具体错误位置,也不复用局部前缀。 | N/A | 260728 |
| Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards(CIPO) | 把 on-policy 失败轨迹转成 correction samples,与标准 RLVR 目标联合优化,提升数学和代码自纠能力。 | 基于完整错误输出生成修正答案,不是从定位出的局部前缀继续 rollout。 | N/A | 260728 |
| Structure Enables Effective Self-Localization of Errors in LLMs(Thought-ICS) | 把推理组织成离散 thought,验证后定位首个错误,从最后正确 thought 回退并重采样替代路径。 | 机制高度相似,但属于推理期自纠和搜索,不更新 RL policy。 | N/A | 260728 |
| Test-Time Scaling via Error Localization(TTEL) | 利用反馈条件与空上下文下的条件概率差定位 token 级错误,截断轨迹并从该点生成新分支,复用有效前缀。 | 能做到更细的 token 级局部重生成,但属于 test-time scaling,不是 RL 训练。 | N/A | 260728 |
| Generator-Assistant Stepwise Rollback Framework for Large Language Model Agent(GA-Rollback) | assistant 逐步检查 generator 的 action,发现错误后触发 rollback,回到此前状态选择新路径。 | 是可插拔的 Agent 推理框架,不属于 RL policy optimization。 | N/A | 260728 |
| Localizing and Correcting Errors for LLM-based Planners(L-ICL) | 找到规划轨迹中首个指令/领域约束违反,并加入只针对失败步骤的最小纠正示例。 | 很贴近“指令不遵循”的错误定位,但通过 localized ICL 修正,不做局部 rollout RL。 | N/A | 260728 |
邻近基础与上下游工作(步级 PRM / 树搜索 RL / 步级偏好,260728 补充)¶
第二轮宽口径检索(OpenAlex API)补充。这些都是上面"最接近"一组所依赖或邻近的基础工作:它们提供"哪一步错"的判据(PRM)或"保留正确前缀、在错误位置分支/对比"的机制,但多数以数学推理为主、且不强调"原地局部重 rollout + 只更新分叉后缀"。带 ✅ 为 OpenAlex 命中确认存在的条目。
| 论文 | arXiv | 简单描述 | 与目标范式的关系 | 本地 PDF | 记录时间 |
|---|---|---|---|---|---|
| Math-Shepherd (Verify and Reinforce Steps) | 2312.08935 | 对每个中间步用"从此步往后 rollout 到终局"的成功率估计该步价值,自动生成步级奖励做 RL。 | 在每个位置都做续延 rollout,是步级价值估计的基础;不显式做"原地局部重生成"。 | N/A | 260728 |
| OmegaPRM (Improve Math Reasoning by Automated Process Supervision) | 2406.06592 ✅ | 用二分搜索定位"第一个错误步",围绕该步生成步级过程奖励标注。 | "定位错误位置"机制的核心代表作;判据侧基础。 | N/A | 260728 |
| ReST-MCTS* | 2406.07494 | MCTS rollout + 步级过程奖励的自我训练;坏分支剪枝、保留正确前缀继续扩展。 | 树搜索式"出错即换支",天然含局部重 rollout 思想。 | N/A | 260728 |
| AlphaMath Almost Zero | 2405.03553 | MCTS 树式 rollout + PPO,无需人工步级标注。 | 沿前缀分支、坏子树丢弃重采。 | N/A | 260728 |
| Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning | 2405.00451 ✅ | MCTS 产生步级偏好数据,做迭代偏好学习。 | 同家族机制。 | N/A | 260728 |
| rStar-Math | 2501.04519 | MCTS 重用正确前缀、对坏步重采样,PPO + 过程偏好联合训练小模型达 GPT-4 级数学。 | 树搜索 + 前缀复用的代表,含局部重 rollout。 | N/A | 260728 |
| Let's Verify Step by Step (PRM800K) | 2305.20050 | 步级过程监督开山作,提供"哪一步错"的判据。 | 触发"位置级重 rollout"的判别器基础。 | N/A | 260728 |
| Q* | 2406.06736 | 过程奖励 + A* 式搜索,沿前缀扩展。 | 定位坏步后从更优前缀续搜。 | N/A | 260728 |
| Step-DPO | 2406.18629 | 步级 DPO:共享正确前缀,仅在某一步换成正确/错误步骤构成偏好对。 | 思想最接近"在出错位置做局部修正",但属偏好优化而非在线 re-rollout。 | N/A | 260728 |
| TPO (Multi-branch & Multi-step Preference Trees) | 2410.12854 ✅ | 多分支、多步偏好树,对中间步做局部偏好优化。 | 沿前缀分支的偏好树。 | N/A | 260728 |
| Advancing LLM Reasoning Generalists with Preference Trees | 2404.02078 ✅ | 用偏好树沿前缀分支训练推理通用模型。 | 同上。 | N/A | 260728 |
| Iterative Reasoning Preference Optimization (IRPO) | 2404.19733 ✅ | 迭代地基于错误步构造偏好对优化推理。 | 错误步级偏好,非局部 rollout。 | N/A | 260728 |
| Focused-DPO (Focused Preference Optimization on Error-Prone Points) | 待查 | 直接在"易错点"上聚焦做偏好优化。 | 命名最贴合,需精读确认是否含局部重 rollout。 | N/A | 260728 |
| LATS (Language Agent Tree Search) | 2310.04406 ✅ | 带回溯的树搜索,发现某状态不好就回退到前驱重展开。 | 推理期局部重 rollout,常用于产生训练数据。 | N/A | 260728 |
| RAP (Reasoning via Planning with World Model) | 2305.14992 | 把推理视为规划,MCTS 式 rollout + 回溯。 | 推理期树搜索。 | N/A | 260728 |
| Tree of Thoughts | 2305.10601 ✅ | 步级评估 + 回溯探索。 | 推理期搜索,非 RL 训练。 | N/A | 260728 |
| AlphaZero-like Tree-Search can Guide LLM Decoding and Training | 2309.17179 ✅ | AlphaZero 式树搜索同时指导解码与训练。 | 搜索 + 训练联合。 | N/A | 260728 |
| SCoRe (Self-Correction via RL) | 2409.12917 | 两阶段 RL 教模型自纠正(DeepMind)。 | 回退行为内化进策略,非外部 re-rollout。 | N/A | 260728 |
| Reflexion | 2303.11366 ✅ | 语言化反馈驱动的重试(verbal RL)。 | 自纠正/重试,不定位具体位置。 | N/A | 260728 |
| Self-Refine | 2303.17651 | 模型自我反馈、迭代修正输出。 | 整段自纠正,非局部。 | N/A | 260728 |
待补检索(第五梯队·工程侧):在线 PPO/GRPO 中"复用正确前缀 KV-cache、只在出错点之后重新 decode"的字面匹配工作。关键词:tree-structured / prefix-shared rollout、speculative / selective re-decode in RLHF、partial rollout RL、prefix-conditional resampling。OpenAlex 关键词检索该支噪声大,需直接 arXiv 检索精确定位。
待继续追问:现有直接工作集中于数学、检索和结构化 Agent turn;开放式自然语言中同时处理逻辑、事实、格式、风格和指令遵循,并定位任意 span/token 后进行可验证局部 rollout,仍值得单独研究。可进一步考察“最小可修复前缀边界(minimal repair frontier)”,而不只寻找第一个可见错误。
专题:用 RL 提升大模型写作能力(2025–2026 景观扫描)¶
260726 整理。检索源:arXiv Export API。机构标注来源:✓ 从 arXiv HTML/PDF 直接解析;◇ HTML 未渲染机构、按作者身份判定;△ 仅确认实习单位、机构未公开。录用信息取自作者在 arXiv 的
Comments字段,标"预印本"= Comments 无会议/期刊信息(多为投稿/在审)。
| 论文 (arXiv) | 年份 | 一作 | 一作机构 | 录用 |
|---|---|---|---|---|
| Writing-Zero | 2025-05 | Ruipeng Jia(v1 PDF 署名 Xun Lu) | StarWritingTeam(团队署名,未公开机构)✓ | 预印本 |
| Writing-RL | 2025-06 | Xuanyu Lei | 清华大学 AIR(+ 电脑系 AI 研究院)✓ | 预印本(代码 Tongyi-Zhiwen) |
| LongWriter-Zero | 2025-06 | Yuhao Wu | THUDM / 智谱 AI(清华大学,系列传承判定)△ | ICLR 2026 Oral |
| RLMR | 2025-08 | Jianxing Liao | 机构未公开(注明实习于腾讯)△ | 预印本 |
| Igniting Creative Writing in SLMs | 2025-08 | Xiaolong Wei | 北京航空航天大学(+ 百度)✓ | EMNLP 2025 Main |
| Jointly Reinforcing Diversity & Quality | 2025-09 | Tianjian Li | Johns Hopkins Univ.(合作 Meta FAIR / CMU)✓ | 预印本 |
| Extending RLVR to Open-Ended(MC 重构) | 2025-11 | Mengyu Zhang | 百度(据 Hua Wu 等作者判定)◇ | 预印本 |
| Rewarding Creativity (RLC) | 2026-01 | Zhaoyan Li | 阿里巴巴(@alibaba-inc.com)✓ | 预印本 |
| DPWriter | 2026-01 | Qian Cao | 中国人民大学(+ 快手)✓ | 预印本 |
| Reward Modeling for Scientific Writing | 2026-01 | Furkan Şahinuç | TU Darmstadt · UKP Lab(hessian.AI)✓ | ACL 2026 Main |
| Retell, Reward, Repeat | 2026-01 | David Y. Liu | 新南威尔士大学 (UNSW) ✓ | 预印本 |
| Expanding RL via Text Feedback | 2026-02 | Yuda Song | 卡内基梅隆大学 CMU(合作 DeepMind)◇ | 预印本 |
| Rubric-ARM | 2026-02 | Ran Xu | 埃默里大学 Emory(+ Purdue / Rutgers)✓ | 预印本 |
| Writer-R1 | 2026-03 | Jihao Zhao | 中国人民大学(信息学院)✓ | 预印本 |
| Long-form RewardBench | 2026-03 | Hui Huang | 哈尔滨工业大学 HIT(作者群判定)◇ | AAAI 2026 |
| R2-Write | 2026-04 | Wanlong Liu | 武汉大学(+ 阿里通义 / 清华 AIR)◇ | 预印本 |
| UniCreative | 2026-04 | Xiaolong Wei | 北京航空航天大学(+ 百度)✓ | Findings of ACL 2026 |
| From Coarse to Fine(写作 RM) | 2026-04 | Qingyu Ren | 复旦大学(上海市数据科学重点实验室)✓ | 预印本 |
| Bootstrapping Rubric Self-play | 2026-04 | Chengyu Huang | 康奈尔大学 Cornell(+ Claire Cardie)✓ | 预印本 |
| OPERA | 2026-06 | Wenxuan Jiang | 香港理工大学 PolyU ✓ | 预印本 |
小结:录用顶会 5 篇——LongWriter-Zero (ICLR'26 Oral)、Igniting Creative Writing (EMNLP'25)、Scientific Writing RM (ACL'26 Main)、Long-form RewardBench (AAAI'26)、UniCreative (ACL'26 Findings)。中国机构活跃:人大(DPWriter、Writer-R1)、北航+百度(Igniting、UniCreative)、阿里(RLC)、清华系(Writing-RL、LongWriter)。共性方法:把"不可验证"的写作质量转成可验证奖励(rubric / GenRM / MC 重构 / 自博弈),用 RLVR/PPO/DPO 变体训练,兼顾长文连贯与多样性。