待学习队列¶
记录用户感兴趣但尚未正式学习的论文、博客、仓库和技术报告。一旦开始学习或分析某条目,就从这里删除。
| 论文 / 资料 | 链接 / ID | 兴趣点 | 本地 PDF | 记录时间 |
|---|---|---|---|---|
| LoRA Without Regret | https://thinkingmachines.ai/blog/lora/#how-much-capacity-is-needed-by-supervised-and-reinforcement-learning | Thinking Machines Lab;LoRA vs full fine-tuning;SFT/RL 所需容量;post-training 参数效率 | N/A | 260712 |
| On-Policy Distillation | https://thinkingmachines.ai/blog/on-policy-distillation/ | Thinking Machines Lab;on-policy distillation;结合 on-policy 采样与 dense teacher feedback;reasoning 与 personalization 后训练 | N/A | 260712 |
| Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit | https://arxiv.org/abs/2606.20711 | 唐杰团队;UI 视频生成交互式网页;action-aware revisit;状态转移对齐 | N/A | 260712 |
| Show HN:如何在低配置电脑上运行 GLM-5.2 / JustVugg colibri | https://github.com/JustVugg/colibri | GLM-5.2 低内存本地推理;C 实现;专家从磁盘流式加载 | N/A | 260712 |
| 2x GH200 for LLM inference, Part 3: GLM-5.2, expert offload, and the CPU question | https://dnhkng.github.io/posts/gh200-benchmarking-part-3-glm52/ | GLM-5.2 在双 GH200 上的推理、expert offload、CPU/内存带宽与 MTP 权衡 | N/A | 260712 |
| IdeaBench: Benchmarking Large Language Models for Research Idea Generation | https://arxiv.org/abs/2411.02429 | research idea generation benchmark;基于论文 title/abstract/reference context 评估 LLM 科研想法生成;novelty/feasibility 等指标 | N/A | 260712 |
| LiveIdeaBench: Evaluating LLMs' Scientific Creativity and Idea Generation with Minimal Context | https://liveideabench.com/ | scientific creativity / idea generation benchmark;single-keyword prompts;originality、feasibility、fluency、flexibility、clarity | N/A | 260712 |
| CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents | https://arxiv.org/abs/2607.05378 | 长时程 agent;上下文压缩;任务执行与摘要生成联合优化;token-level loss normalization;cross-trajectory GAE | N/A | 260713 |
| FireAct: Toward Language Agent Fine-tuning | https://arxiv.org/abs/2310.05915 | language agent fine-tuning;多任务、多 prompting method 的 agent trajectories;泛化、鲁棒性、效率与成本 | N/A | 260724 |
| TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling | https://arxiv.org/abs/2508.17445 | DPWriter 引用的分支/分叉策略;tree-based 启发式建模;策略优化与推理效率 | N/A | 260727 |
| Segment Policy Optimization (SPO) | https://arxiv.org/abs/2505.23564 | DPWriter 引用的分支策略;segment-level credit assignment;RL for LLMs | N/A | 260727 |
| First Return, Entropy-Eliciting Explore | https://arxiv.org/abs/2507.07017 | DPWriter 引用的分支/探索策略;first-return + entropy-eliciting exploration;rollout 多样性 | N/A | 260727 |
| NoveltyBench: Evaluating Language Models for Humanlike Diversity | https://arxiv.org/abs/2504.05228 | 多样性评测基准;DPWriter 与 Darling 共用的 Distinct 指标来源;用二分类器把输出划语义等价类、数类数(id/标题经 DPWriter、Darling 两篇引用互证,arXiv API 本次限流未直查) | N/A | 260727 |
专题:用 RL 提升大模型写作能力(2025–2026 景观扫描)¶
260726 整理。检索源:arXiv Export API。机构标注来源:✓ 从 arXiv HTML/PDF 直接解析;◇ HTML 未渲染机构、按作者身份判定;△ 仅确认实习单位、机构未公开。录用信息取自作者在 arXiv 的
Comments字段,标"预印本"= Comments 无会议/期刊信息(多为投稿/在审)。
| 论文 (arXiv) | 年份 | 一作 | 一作机构 | 录用 |
|---|---|---|---|---|
| Writing-Zero | 2025-05 | Ruipeng Jia(v1 PDF 署名 Xun Lu) | StarWritingTeam(团队署名,未公开机构)✓ | 预印本 |
| Writing-RL | 2025-06 | Xuanyu Lei | 清华大学 AIR(+ 电脑系 AI 研究院)✓ | 预印本(代码 Tongyi-Zhiwen) |
| LongWriter-Zero | 2025-06 | Yuhao Wu | THUDM / 智谱 AI(清华大学,系列传承判定)△ | ICLR 2026 Oral |
| RLMR | 2025-08 | Jianxing Liao | 机构未公开(注明实习于腾讯)△ | 预印本 |
| Igniting Creative Writing in SLMs | 2025-08 | Xiaolong Wei | 北京航空航天大学(+ 百度)✓ | EMNLP 2025 Main |
| Jointly Reinforcing Diversity & Quality | 2025-09 | Tianjian Li | Johns Hopkins Univ.(合作 Meta FAIR / CMU)✓ | 预印本 |
| Extending RLVR to Open-Ended(MC 重构) | 2025-11 | Mengyu Zhang | 百度(据 Hua Wu 等作者判定)◇ | 预印本 |
| Rewarding Creativity (RLC) | 2026-01 | Zhaoyan Li | 阿里巴巴(@alibaba-inc.com)✓ | 预印本 |
| DPWriter | 2026-01 | Qian Cao | 中国人民大学(+ 快手)✓ | 预印本 |
| Reward Modeling for Scientific Writing | 2026-01 | Furkan Şahinuç | TU Darmstadt · UKP Lab(hessian.AI)✓ | ACL 2026 Main |
| Retell, Reward, Repeat | 2026-01 | David Y. Liu | 新南威尔士大学 (UNSW) ✓ | 预印本 |
| Expanding RL via Text Feedback | 2026-02 | Yuda Song | 卡内基梅隆大学 CMU(合作 DeepMind)◇ | 预印本 |
| Rubric-ARM | 2026-02 | Ran Xu | 埃默里大学 Emory(+ Purdue / Rutgers)✓ | 预印本 |
| Writer-R1 | 2026-03 | Jihao Zhao | 中国人民大学(信息学院)✓ | 预印本 |
| Long-form RewardBench | 2026-03 | Hui Huang | 哈尔滨工业大学 HIT(作者群判定)◇ | AAAI 2026 |
| R2-Write | 2026-04 | Wanlong Liu | 武汉大学(+ 阿里通义 / 清华 AIR)◇ | 预印本 |
| UniCreative | 2026-04 | Xiaolong Wei | 北京航空航天大学(+ 百度)✓ | Findings of ACL 2026 |
| From Coarse to Fine(写作 RM) | 2026-04 | Qingyu Ren | 复旦大学(上海市数据科学重点实验室)✓ | 预印本 |
| Bootstrapping Rubric Self-play | 2026-04 | Chengyu Huang | 康奈尔大学 Cornell(+ Claire Cardie)✓ | 预印本 |
| OPERA | 2026-06 | Wenxuan Jiang | 香港理工大学 PolyU ✓ | 预印本 |
小结:录用顶会 5 篇——LongWriter-Zero (ICLR'26 Oral)、Igniting Creative Writing (EMNLP'25)、Scientific Writing RM (ACL'26 Main)、Long-form RewardBench (AAAI'26)、UniCreative (ACL'26 Findings)。中国机构活跃:人大(DPWriter、Writer-R1)、北航+百度(Igniting、UniCreative)、阿里(RLC)、清华系(Writing-RL、LongWriter)。共性方法:把"不可验证"的写作质量转成可验证奖励(rubric / GenRM / MC 重构 / 自博弈),用 RLVR/PPO/DPO 变体训练,兼顾长文连贯与多样性。