跳转至

待学习队列

记录用户感兴趣但尚未正式学习的论文、博客、仓库和技术报告。一旦开始学习或分析某条目,就从这里删除。

论文 / 资料 链接 / ID 兴趣点 本地 PDF 记录时间
LoRA Without Regret https://thinkingmachines.ai/blog/lora/#how-much-capacity-is-needed-by-supervised-and-reinforcement-learning Thinking Machines Lab;LoRA vs full fine-tuning;SFT/RL 所需容量;post-training 参数效率 N/A 260712
On-Policy Distillation https://thinkingmachines.ai/blog/on-policy-distillation/ Thinking Machines Lab;on-policy distillation;结合 on-policy 采样与 dense teacher feedback;reasoning 与 personalization 后训练 N/A 260712
Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit https://arxiv.org/abs/2606.20711 唐杰团队;UI 视频生成交互式网页;action-aware revisit;状态转移对齐 N/A 260712
Show HN:如何在低配置电脑上运行 GLM-5.2 / JustVugg colibri https://github.com/JustVugg/colibri GLM-5.2 低内存本地推理;C 实现;专家从磁盘流式加载 N/A 260712
2x GH200 for LLM inference, Part 3: GLM-5.2, expert offload, and the CPU question https://dnhkng.github.io/posts/gh200-benchmarking-part-3-glm52/ GLM-5.2 在双 GH200 上的推理、expert offload、CPU/内存带宽与 MTP 权衡 N/A 260712
IdeaBench: Benchmarking Large Language Models for Research Idea Generation https://arxiv.org/abs/2411.02429 research idea generation benchmark;基于论文 title/abstract/reference context 评估 LLM 科研想法生成;novelty/feasibility 等指标 N/A 260712
LiveIdeaBench: Evaluating LLMs' Scientific Creativity and Idea Generation with Minimal Context https://liveideabench.com/ scientific creativity / idea generation benchmark;single-keyword prompts;originality、feasibility、fluency、flexibility、clarity N/A 260712
CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents https://arxiv.org/abs/2607.05378 长时程 agent;上下文压缩;任务执行与摘要生成联合优化;token-level loss normalization;cross-trajectory GAE N/A 260713
FireAct: Toward Language Agent Fine-tuning https://arxiv.org/abs/2310.05915 language agent fine-tuning;多任务、多 prompting method 的 agent trajectories;泛化、鲁棒性、效率与成本 N/A 260724
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling https://arxiv.org/abs/2508.17445 DPWriter 引用的分支/分叉策略;tree-based 启发式建模;策略优化与推理效率 N/A 260727
Segment Policy Optimization (SPO) https://arxiv.org/abs/2505.23564 DPWriter 引用的分支策略;segment-level credit assignment;RL for LLMs N/A 260727
First Return, Entropy-Eliciting Explore https://arxiv.org/abs/2507.07017 DPWriter 引用的分支/探索策略;first-return + entropy-eliciting exploration;rollout 多样性 N/A 260727
NoveltyBench: Evaluating Language Models for Humanlike Diversity https://arxiv.org/abs/2504.05228 多样性评测基准;DPWriter 与 Darling 共用的 Distinct 指标来源;用二分类器把输出划语义等价类、数类数(id/标题经 DPWriter、Darling 两篇引用互证,arXiv API 本次限流未直查) N/A 260727

专题:用 RL 提升大模型写作能力(2025–2026 景观扫描)

260726 整理。检索源:arXiv Export API。机构标注来源: 从 arXiv HTML/PDF 直接解析; HTML 未渲染机构、按作者身份判定; 仅确认实习单位、机构未公开。录用信息取自作者在 arXiv 的 Comments 字段,标"预印本"= Comments 无会议/期刊信息(多为投稿/在审)。

论文 (arXiv) 年份 一作 一作机构 录用
Writing-Zero 2025-05 Ruipeng Jia(v1 PDF 署名 Xun Lu) StarWritingTeam(团队署名,未公开机构)✓ 预印本
Writing-RL 2025-06 Xuanyu Lei 清华大学 AIR(+ 电脑系 AI 研究院)✓ 预印本(代码 Tongyi-Zhiwen)
LongWriter-Zero 2025-06 Yuhao Wu THUDM / 智谱 AI(清华大学,系列传承判定)△ ICLR 2026 Oral
RLMR 2025-08 Jianxing Liao 机构未公开(注明实习于腾讯)△ 预印本
Igniting Creative Writing in SLMs 2025-08 Xiaolong Wei 北京航空航天大学(+ 百度)✓ EMNLP 2025 Main
Jointly Reinforcing Diversity & Quality 2025-09 Tianjian Li Johns Hopkins Univ.(合作 Meta FAIR / CMU)✓ 预印本
Extending RLVR to Open-Ended(MC 重构) 2025-11 Mengyu Zhang 百度(据 Hua Wu 等作者判定)◇ 预印本
Rewarding Creativity (RLC) 2026-01 Zhaoyan Li 阿里巴巴(@alibaba-inc.com)✓ 预印本
DPWriter 2026-01 Qian Cao 中国人民大学(+ 快手)✓ 预印本
Reward Modeling for Scientific Writing 2026-01 Furkan Şahinuç TU Darmstadt · UKP Lab(hessian.AI)✓ ACL 2026 Main
Retell, Reward, Repeat 2026-01 David Y. Liu 新南威尔士大学 (UNSW) ✓ 预印本
Expanding RL via Text Feedback 2026-02 Yuda Song 卡内基梅隆大学 CMU(合作 DeepMind)◇ 预印本
Rubric-ARM 2026-02 Ran Xu 埃默里大学 Emory(+ Purdue / Rutgers)✓ 预印本
Writer-R1 2026-03 Jihao Zhao 中国人民大学(信息学院)✓ 预印本
Long-form RewardBench 2026-03 Hui Huang 哈尔滨工业大学 HIT(作者群判定)◇ AAAI 2026
R2-Write 2026-04 Wanlong Liu 武汉大学(+ 阿里通义 / 清华 AIR)◇ 预印本
UniCreative 2026-04 Xiaolong Wei 北京航空航天大学(+ 百度)✓ Findings of ACL 2026
From Coarse to Fine(写作 RM) 2026-04 Qingyu Ren 复旦大学(上海市数据科学重点实验室)✓ 预印本
Bootstrapping Rubric Self-play 2026-04 Chengyu Huang 康奈尔大学 Cornell(+ Claire Cardie)✓ 预印本
OPERA 2026-06 Wenxuan Jiang 香港理工大学 PolyU ✓ 预印本

小结:录用顶会 5 篇——LongWriter-Zero (ICLR'26 Oral)、Igniting Creative Writing (EMNLP'25)、Scientific Writing RM (ACL'26 Main)、Long-form RewardBench (AAAI'26)、UniCreative (ACL'26 Findings)。中国机构活跃:人大(DPWriter、Writer-R1)、北航+百度(Igniting、UniCreative)、阿里(RLC)、清华系(Writing-RL、LongWriter)。共性方法:把"不可验证"的写作质量转成可验证奖励(rubric / GenRM / MC 重构 / 自博弈),用 RLVR/PPO/DPO 变体训练,兼顾长文连贯与多样性。