跳转至

MemSlides 精简解析

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-02 评分:0 领域:agent 方法:agent-fw 类型:framework

论文: MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision
arXiv: 2606.17162v1,2026-06-15
作者: Ye Jin, Yangyang Xu, Jun Zhu, Yibo Yang
PDF: paper.pdf
译文: main_zh.md

一句话

MemSlides 把“个性化幻灯片生成”从一次性 prompt/template conditioning,推进到带长期用户画像、会话工作记忆和工具执行记忆的多轮 Agent 系统,重点解决跨任务偏好保持和局部修改不漂移的问题。

问题定位

现有 slide generation agent 已经能生成完整且好看的 deck,但个性化通常依赖当前 prompt、参考 slides 或模板。用户在真实创作中往往不是一开始说清楚全部偏好,而是在多轮修改中逐步暴露偏好,例如“标题以后都用这种颜色”“这一类技术汇报要先讲模块边界”。如果系统每次都重读/重写整套 deck,小修改容易引发非目标区域变化,也很难把这些反馈沉淀为后续任务可复用的记忆。

方法核心

MemSlides 的核心是三类记忆加一个局部修改执行策略:

  • 用户画像记忆:长期、跨 job 保存用户在不同 intent 下的偏好,按主题、内容、视觉、布局、模板、通用习惯等维度组织。
  • 工作记忆:会话内有效,保存当前 deck 的临时偏好、修改约束和编辑状态,用于多轮承接。
  • 工具记忆:保存可复用执行经验,帮助 agent 少重复错误,提升局部编辑和验证可靠性。
  • Scoped slide-local revision:把修改请求映射到最小受影响区域,通过 Plan-Act-Guard 执行,只读局部结构快照,只写受限 selector/rule patch,避免全 deck 重生成。

主要实验结论

在 persona-alignment evaluation 中,MemSlides 在 GLM-5 和 Gemini 3.1 Pro 上四个维度都优于 DeepPresenter 和 SlideTailor;在 GPT-5 上也多数维度领先。跨模型平均看,MemSlides 相对 DeepPresenter 在 Content、Structure、Visual、Specificity 上分别提升 1.37、0.53、1.66、1.19 分,相对 SlideTailor 分别提升 2.73、2.95、2.79、3.08 分。

在局部修改实验中,工具记忆注入把整体 Closed-Loop Completion 从 0.815 提升到 0.963,Strict Verify 从 0.310 提升到 0.534,首次正确编辑时间从 609.5s 降到 242.5s,Core Tool Time Ratio 降到 0.327x。

我的理解

这篇论文的价值不在于提出一个更强的 PPT 模板生成器,而在于把 slide authoring 当成一个长期交互系统来建模。它明确区分了三种容易混在一起的信号:用户真正长期稳定的审美/结构偏好、当前会话临时要求、以及工具执行层面的经验。这种拆分对所有“可编辑创作 Agent”都很有参考价值,不只适用于幻灯片。

局限

论文证据主要来自受控 profile bank、诊断 matched-pair 修改实验和定性案例,还不是大规模真实用户部署。个性化记忆一旦进入真实产品,还需要更强的 consent、delete、更正、敏感偏好保护和隐私治理。