跳转至

待学习队列

记录用户感兴趣但尚未正式学习的论文、博客、仓库和技术报告。一旦开始学习或分析某条目,就从这里删除。

论文 / 资料 链接 / ID 兴趣点 本地 PDF 记录时间
LoRA Without Regret https://thinkingmachines.ai/blog/lora/#how-much-capacity-is-needed-by-supervised-and-reinforcement-learning Thinking Machines Lab;LoRA vs full fine-tuning;SFT/RL 所需容量;post-training 参数效率 N/A 260712
On-Policy Distillation https://thinkingmachines.ai/blog/on-policy-distillation/ Thinking Machines Lab;on-policy distillation;结合 on-policy 采样与 dense teacher feedback;reasoning 与 personalization 后训练 N/A 260712
Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit https://arxiv.org/abs/2606.20711 唐杰团队;UI 视频生成交互式网页;action-aware revisit;状态转移对齐 N/A 260712
Show HN:如何在低配置电脑上运行 GLM-5.2 / JustVugg colibri https://github.com/JustVugg/colibri GLM-5.2 低内存本地推理;C 实现;专家从磁盘流式加载 N/A 260712
2x GH200 for LLM inference, Part 3: GLM-5.2, expert offload, and the CPU question https://dnhkng.github.io/posts/gh200-benchmarking-part-3-glm52/ GLM-5.2 在双 GH200 上的推理、expert offload、CPU/内存带宽与 MTP 权衡 N/A 260712
IdeaBench: Benchmarking Large Language Models for Research Idea Generation https://arxiv.org/abs/2411.02429 research idea generation benchmark;基于论文 title/abstract/reference context 评估 LLM 科研想法生成;novelty/feasibility 等指标 N/A 260712
LiveIdeaBench: Evaluating LLMs' Scientific Creativity and Idea Generation with Minimal Context https://liveideabench.com/ scientific creativity / idea generation benchmark;single-keyword prompts;originality、feasibility、fluency、flexibility、clarity N/A 260712
CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents https://arxiv.org/abs/2607.05378 长时程 agent;上下文压缩;任务执行与摘要生成联合优化;token-level loss normalization;cross-trajectory GAE N/A 260713
FireAct: Toward Language Agent Fine-tuning https://arxiv.org/abs/2310.05915 language agent fine-tuning;多任务、多 prompting method 的 agent trajectories;泛化、鲁棒性、效率与成本 N/A 260724
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling https://arxiv.org/abs/2508.17445 DPWriter 引用的分支/分叉策略;tree-based 启发式建模;策略优化与推理效率 N/A 260727
Segment Policy Optimization (SPO) https://arxiv.org/abs/2505.23564 DPWriter 引用的分支策略;segment-level credit assignment;RL for LLMs N/A 260727
First Return, Entropy-Eliciting Explore https://arxiv.org/abs/2507.07017 DPWriter 引用的分支/探索策略;first-return + entropy-eliciting exploration;rollout 多样性 N/A 260727
NoveltyBench: Evaluating Language Models for Humanlike Diversity https://arxiv.org/abs/2504.05228 多样性评测基准;DPWriter 与 Darling 共用的 Distinct 指标来源;用二分类器把输出划语义等价类、数类数(id/标题经 DPWriter、Darling 两篇引用互证,arXiv API 本次限流未直查) N/A 260727

专题:错误定位后局部重新 rollout

260728 宽口径检索。目标范式:检查模型输出或 Agent 轨迹,定位逻辑错误、动作错误或指令违反出现的位置,保留此前正确前缀,并从错误点重新 rollout;训练时尽量只更新分叉后的部分。

最接近

论文 简单描述 与目标范式的关系 本地 PDF 记录时间
Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs(ERL;ICLR 2026 Poster) 用分解、检索和子答案的过程奖励识别错误步骤,擦除对应 action unit,截断到最近正确状态后原地重生成。 直接实现“识别错误—保留前缀—局部重生成”;目前主要面向多跳搜索。 N/A 260728
R³L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification 根据错误信息、执行轨迹和环境反馈生成结构化反思,定位错误首次出现的 pivot turn,从该处带纠错指导重新生成,并只优化分叉后缀。 与目标的通用自然语言表述最接近;覆盖数学推理和 Agent 任务。 N/A 260728
Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry(PivoARL) 自反思输出最早错误 turn 和改进 remark,环境回放到该状态,仅重做错误 turn 之后的轨迹,并隔离错误后缀的 credit。 完整实现 Agent RL 中的“reflect → locate → local retry”。 N/A 260728
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning 联合训练 generator 和 generative verifier;verifier 用逐步语言反馈定位 First Point of Failure,再从一个或多个已验证前缀锚点重定向 rollout。 同时包含学习式错误检查、局部重生成和 RL;当前以数学、逻辑和代码推理为主。 N/A 260728
Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning(ELPO) 固定候选前缀并多次采样后缀,用二分 rollout tree 找到第一个不可恢复步骤,再做局部 advantage attribution 和针对性更新。 通过反事实可恢复性而非一次语言判断定位错误;更接近因果定位,但采样成本更高。 N/A 260728
Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs(E³RL) 用模型自身局部交叉熵和动态阈值检测异常 segment,删除局部缺陷、复用此前 KV cache 并重新生成。 具备 segment 级擦除和重 rollout;以不确定性代理逻辑错误,不依赖外部 verifier。 N/A 260728

相关但不完全符合

论文 简单描述 不完全符合之处 本地 PDF 记录时间
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning(VPPO;Findings of ACL 2026) 用 PRM 定位第一个错误,将失败轨迹拆成 verified good prefix 和错误后缀,只惩罚错误之后的部分。 定位结果主要用于 credit assignment,没有从错误点生成修复后缀。 N/A 260728
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning 模型借助参考解定位首个错误、提出单步 intervention,并从修正处生成反事实 continuation;随后用这些 intervention 做 SFT,再继续 RL。 有局部修复和续写,但核心训练信号是 intervention SFT,不是直接的局部 rollout RL。 N/A 260728
Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning 首次失败后生成自反思,再把反思放入上下文完整重试;若第二次成功,就奖励反思 token。 使用 RL 学会反思,但没有定位具体错误位置,也不复用局部前缀。 N/A 260728
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards(CIPO) 把 on-policy 失败轨迹转成 correction samples,与标准 RLVR 目标联合优化,提升数学和代码自纠能力。 基于完整错误输出生成修正答案,不是从定位出的局部前缀继续 rollout。 N/A 260728
Structure Enables Effective Self-Localization of Errors in LLMs(Thought-ICS) 把推理组织成离散 thought,验证后定位首个错误,从最后正确 thought 回退并重采样替代路径。 机制高度相似,但属于推理期自纠和搜索,不更新 RL policy。 N/A 260728
Test-Time Scaling via Error Localization(TTEL) 利用反馈条件与空上下文下的条件概率差定位 token 级错误,截断轨迹并从该点生成新分支,复用有效前缀。 能做到更细的 token 级局部重生成,但属于 test-time scaling,不是 RL 训练。 N/A 260728
Generator-Assistant Stepwise Rollback Framework for Large Language Model Agent(GA-Rollback) assistant 逐步检查 generator 的 action,发现错误后触发 rollback,回到此前状态选择新路径。 是可插拔的 Agent 推理框架,不属于 RL policy optimization。 N/A 260728
Localizing and Correcting Errors for LLM-based Planners(L-ICL) 找到规划轨迹中首个指令/领域约束违反,并加入只针对失败步骤的最小纠正示例。 很贴近“指令不遵循”的错误定位,但通过 localized ICL 修正,不做局部 rollout RL。 N/A 260728

邻近基础与上下游工作(步级 PRM / 树搜索 RL / 步级偏好,260728 补充)

第二轮宽口径检索(OpenAlex API)补充。这些都是上面"最接近"一组所依赖或邻近的基础工作:它们提供"哪一步错"的判据(PRM)或"保留正确前缀、在错误位置分支/对比"的机制,但多数以数学推理为主、且不强调"原地局部重 rollout + 只更新分叉后缀"。带 ✅ 为 OpenAlex 命中确认存在的条目。

论文 arXiv 简单描述 与目标范式的关系 本地 PDF 记录时间
Math-Shepherd (Verify and Reinforce Steps) 2312.08935 对每个中间步用"从此步往后 rollout 到终局"的成功率估计该步价值,自动生成步级奖励做 RL。 在每个位置都做续延 rollout,是步级价值估计的基础;不显式做"原地局部重生成"。 N/A 260728
OmegaPRM (Improve Math Reasoning by Automated Process Supervision) 2406.06592 ✅ 用二分搜索定位"第一个错误步",围绕该步生成步级过程奖励标注。 "定位错误位置"机制的核心代表作;判据侧基础。 N/A 260728
ReST-MCTS* 2406.07494 MCTS rollout + 步级过程奖励的自我训练;坏分支剪枝、保留正确前缀继续扩展。 树搜索式"出错即换支",天然含局部重 rollout 思想。 N/A 260728
AlphaMath Almost Zero 2405.03553 MCTS 树式 rollout + PPO,无需人工步级标注。 沿前缀分支、坏子树丢弃重采。 N/A 260728
Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning 2405.00451 ✅ MCTS 产生步级偏好数据,做迭代偏好学习。 同家族机制。 N/A 260728
rStar-Math 2501.04519 MCTS 重用正确前缀、对坏步重采样,PPO + 过程偏好联合训练小模型达 GPT-4 级数学。 树搜索 + 前缀复用的代表,含局部重 rollout。 N/A 260728
Let's Verify Step by Step (PRM800K) 2305.20050 步级过程监督开山作,提供"哪一步错"的判据。 触发"位置级重 rollout"的判别器基础。 N/A 260728
Q* 2406.06736 过程奖励 + A* 式搜索,沿前缀扩展。 定位坏步后从更优前缀续搜。 N/A 260728
Step-DPO 2406.18629 步级 DPO:共享正确前缀,仅在某一步换成正确/错误步骤构成偏好对。 思想最接近"在出错位置做局部修正",但属偏好优化而非在线 re-rollout。 N/A 260728
TPO (Multi-branch & Multi-step Preference Trees) 2410.12854 ✅ 多分支、多步偏好树,对中间步做局部偏好优化。 沿前缀分支的偏好树。 N/A 260728
Advancing LLM Reasoning Generalists with Preference Trees 2404.02078 ✅ 用偏好树沿前缀分支训练推理通用模型。 同上。 N/A 260728
Iterative Reasoning Preference Optimization (IRPO) 2404.19733 ✅ 迭代地基于错误步构造偏好对优化推理。 错误步级偏好,非局部 rollout。 N/A 260728
Focused-DPO (Focused Preference Optimization on Error-Prone Points) 待查 直接在"易错点"上聚焦做偏好优化。 命名最贴合,需精读确认是否含局部重 rollout。 N/A 260728
LATS (Language Agent Tree Search) 2310.04406 ✅ 带回溯的树搜索,发现某状态不好就回退到前驱重展开。 推理期局部重 rollout,常用于产生训练数据。 N/A 260728
RAP (Reasoning via Planning with World Model) 2305.14992 把推理视为规划,MCTS 式 rollout + 回溯。 推理期树搜索。 N/A 260728
Tree of Thoughts 2305.10601 ✅ 步级评估 + 回溯探索。 推理期搜索,非 RL 训练。 N/A 260728
AlphaZero-like Tree-Search can Guide LLM Decoding and Training 2309.17179 ✅ AlphaZero 式树搜索同时指导解码与训练。 搜索 + 训练联合。 N/A 260728
SCoRe (Self-Correction via RL) 2409.12917 两阶段 RL 教模型自纠正(DeepMind)。 回退行为内化进策略,非外部 re-rollout。 N/A 260728
Reflexion 2303.11366 ✅ 语言化反馈驱动的重试(verbal RL)。 自纠正/重试,不定位具体位置。 N/A 260728
Self-Refine 2303.17651 模型自我反馈、迭代修正输出。 整段自纠正,非局部。 N/A 260728

待补检索(第五梯队·工程侧):在线 PPO/GRPO 中"复用正确前缀 KV-cache、只在出错点之后重新 decode"的字面匹配工作。关键词:tree-structured / prefix-shared rolloutspeculative / selective re-decode in RLHFpartial rollout RLprefix-conditional resampling。OpenAlex 关键词检索该支噪声大,需直接 arXiv 检索精确定位。

待继续追问:现有直接工作集中于数学、检索和结构化 Agent turn;开放式自然语言中同时处理逻辑、事实、格式、风格和指令遵循,并定位任意 span/token 后进行可验证局部 rollout,仍值得单独研究。可进一步考察“最小可修复前缀边界(minimal repair frontier)”,而不只寻找第一个可见错误。


专题:用 RL 提升大模型写作能力(2025–2026 景观扫描)

260726 整理。检索源:arXiv Export API。机构标注来源: 从 arXiv HTML/PDF 直接解析; HTML 未渲染机构、按作者身份判定; 仅确认实习单位、机构未公开。录用信息取自作者在 arXiv 的 Comments 字段,标"预印本"= Comments 无会议/期刊信息(多为投稿/在审)。

论文 (arXiv) 年份 一作 一作机构 录用
Writing-Zero 2025-05 Ruipeng Jia(v1 PDF 署名 Xun Lu) StarWritingTeam(团队署名,未公开机构)✓ 预印本
Writing-RL 2025-06 Xuanyu Lei 清华大学 AIR(+ 电脑系 AI 研究院)✓ 预印本(代码 Tongyi-Zhiwen)
LongWriter-Zero 2025-06 Yuhao Wu THUDM / 智谱 AI(清华大学,系列传承判定)△ ICLR 2026 Oral
RLMR 2025-08 Jianxing Liao 机构未公开(注明实习于腾讯)△ 预印本
Igniting Creative Writing in SLMs 2025-08 Xiaolong Wei 北京航空航天大学(+ 百度)✓ EMNLP 2025 Main
Jointly Reinforcing Diversity & Quality 2025-09 Tianjian Li Johns Hopkins Univ.(合作 Meta FAIR / CMU)✓ 预印本
Extending RLVR to Open-Ended(MC 重构) 2025-11 Mengyu Zhang 百度(据 Hua Wu 等作者判定)◇ 预印本
Rewarding Creativity (RLC) 2026-01 Zhaoyan Li 阿里巴巴(@alibaba-inc.com)✓ 预印本
DPWriter 2026-01 Qian Cao 中国人民大学(+ 快手)✓ 预印本
Reward Modeling for Scientific Writing 2026-01 Furkan Şahinuç TU Darmstadt · UKP Lab(hessian.AI)✓ ACL 2026 Main
Retell, Reward, Repeat 2026-01 David Y. Liu 新南威尔士大学 (UNSW) ✓ 预印本
Expanding RL via Text Feedback 2026-02 Yuda Song 卡内基梅隆大学 CMU(合作 DeepMind)◇ 预印本
Rubric-ARM 2026-02 Ran Xu 埃默里大学 Emory(+ Purdue / Rutgers)✓ 预印本
Writer-R1 2026-03 Jihao Zhao 中国人民大学(信息学院)✓ 预印本
Long-form RewardBench 2026-03 Hui Huang 哈尔滨工业大学 HIT(作者群判定)◇ AAAI 2026
R2-Write 2026-04 Wanlong Liu 武汉大学(+ 阿里通义 / 清华 AIR)◇ 预印本
UniCreative 2026-04 Xiaolong Wei 北京航空航天大学(+ 百度)✓ Findings of ACL 2026
From Coarse to Fine(写作 RM) 2026-04 Qingyu Ren 复旦大学(上海市数据科学重点实验室)✓ 预印本
Bootstrapping Rubric Self-play 2026-04 Chengyu Huang 康奈尔大学 Cornell(+ Claire Cardie)✓ 预印本
OPERA 2026-06 Wenxuan Jiang 香港理工大学 PolyU ✓ 预印本

小结:录用顶会 5 篇——LongWriter-Zero (ICLR'26 Oral)、Igniting Creative Writing (EMNLP'25)、Scientific Writing RM (ACL'26 Main)、Long-form RewardBench (AAAI'26)、UniCreative (ACL'26 Findings)。中国机构活跃:人大(DPWriter、Writer-R1)、北航+百度(Igniting、UniCreative)、阿里(RLC)、清华系(Writing-RL、LongWriter)。共性方法:把"不可验证"的写作质量转成可验证奖励(rubric / GenRM / MC 重构 / 自博弈),用 RLVR/PPO/DPO 变体训练,兼顾长文连贯与多样性。