MemSlides:面向个性化幻灯片生成与多轮局部修改的层次化记忆驱动 Agent 框架¶
作者: Ye Jin, Yangyang Xu, Jun Zhu, Yibo Yang。
机构: 北京邮电大学、清华大学、上海交通大学。
版本: arXiv:2606.17162v1,2026-06-15。
来源: 基于 arXiv LaTeX source source/main.tex 及 sections/、tables/ 翻译整理。
译注:本文保留关键公式、图注、表格和实验数字,便于追溯。附录中超长 profile bank 与部分逐样例明细未逐行全量翻译,已保留核心协议、结论和主要表格。
摘要¶
个性化演示文稿生成不能只依赖当前 prompt 或当前模板。Agent 需要在不同任务之间保留稳定的用户偏好,在多轮修改中记住新引入的偏好和约束,并可靠执行局部编辑。本文提出 MemSlides,一个面向个性化演示文稿 Agent 的层次化记忆框架。它把长期记忆和工作记忆分开,并进一步把长期记忆划分为用户画像记忆和工具记忆。用户画像记忆存储与意图相关的用户 profile,用于第 0 轮个性化生成;工作记忆在多轮修改中携带当前活跃偏好和会话约束;工具记忆保存可复用的执行经验,用于可靠的局部编辑。
MemSlides 将这种记忆设计与受限的幻灯片局部修改结合起来:目标更新作用于最小受影响区域,而不是反复重新生成整套幻灯片。在受控实验中,用户画像记忆提升了多 persona、多 intent profile bank 上的 persona 对齐判断;工具记忆注入提升了诊断性 matched-pair 设置中的闭环修改行为;定性案例展示了工作记忆承接偏好的能力。总体而言,这些结果说明,有效的个性化演示文稿创作依赖于区分持久用户画像、会话级工作记忆和跨生成/局部修改可复用的执行经验。
引言¶
自动演示文稿生成旨在把用户请求转化为结构化 slide deck。由于幻灯片广泛用于教学、汇报、商务和研究交流,而高质量制作仍然耗时且认知负担高,这一方向受到越来越多关注。近期 agentic 系统通过多模态或工具化 workflow 进一步推进了该任务,已经能够生成完整且视觉效果较好的 deck。
但这些系统仍缺少持久个性化。这对生成可直接使用的幻灯片很关键,因为用户在领域、目的、风格和演示习惯上差异很大。例如,同一个用户在做学术报告和商务汇报时,可能偏好不同的布局、模板和表达方式。有效的个性化 slide generation 框架应当跨任务构建并维护用户 profile,捕捉用户在组织、样式和修改方面的长期偏好,而不是要求用户每次交互都重复说明。
已有工作逐步扩展了演示文稿生成能力。PPTAgent 将生成与演示文稿特定评估结合起来;DeepPresenter 引入环境 grounded reflection;SlideTailor 通过参考 slides 和任务时模板进行个性化科学幻灯片生成。但这些方法要么主要提升通用生成和 agentic refinement,要么把个性化绑定到当前输入样例或模板条件,而不是积累出的用户 profile。
因此,本文指出一个核心缺口:现有 slide generation agent 还缺少面向用户的多轮对话过程,能够把修改请求转化成可复用的偏好记忆,并在后续轮次中保持局部修改约束。
图 1: MemSlides 总览。第 $t$ 轮中,$s_t$ 是当前会话状态,$f_t$ 是用户反馈,$s_{t+1}$ 是经过 Modify Exec 后的更新状态。
这个缺口有两个根源。第一,演示文稿创作中的个性化常常通过修改过程逐步暴露,而不是在生成前一次性完整说明。但现有 agent 仍常通过重新上下文化或重新生成 deck 大部分内容来处理编辑。于是,小修改必须与 deck 状态和反馈历史竞争有限上下文,导致多轮局部修改脆弱。第二,现有系统主要改进工作流、工具和评估器,却仍把个性化当作 prompt 的隐式副产物,而不是通过显式记忆设计提供的核心能力。
为解决这些问题,MemSlides 引入 scoped slide locality 作为多轮 slide editing 的修改策略。它不在每轮反馈中重新读取或重写整套 deck,而是把请求投射到最小受影响的 slide 区域,在有边界的 repair surface 上操作。系统只读取该局部区域的结构化快照,包括局部布局结构、可用 selector 和暴露的样式规则;写回时也只生成作用于显式 selector 或这些样式规则的 patch。这样,读写都在结构上保持局部,减少上下文压力和非目标漂移,同时保留已经对齐的内容。
在此基础上,MemSlides 进一步整合层次化记忆框架。该框架有两层:长期记忆和工作记忆。工作记忆维护当前会话状态和跨修改轮次的临时反馈,使后续局部编辑能够保持同一 deck 内仍然有效的临时记忆。长期记忆跨 job 持久存在,并进一步分为用户画像记忆和工具记忆。用户画像记忆是用户特定且意图感知的:对每个用户和每种意图,偏好按主题、内容、视觉、布局、模板、通用习惯等维度组织,并在每个 job 开始时路由到工作记忆。工具记忆捕捉可复用的执行经验,用于后续编辑。
本文贡献有三点:
- 提出 MemSlides,一个支持多轮局部修改的个性化演示文稿 Agent。它维护会话状态,并用目标 slide 级更新替代反复全 deck 重新生成,为从修改反馈中学习用户偏好提供交互基础。
- 提出由长期记忆和工作记忆构成的层次化记忆框架。长期记忆包含用户画像记忆和工具记忆,使稳定用户偏好和可复用执行经验可以跨 job 持久保存;工作记忆跟踪会话特定约束。
- 构建用于个性化演示文稿生成评估的多 persona、多 intent 用户 profile bank。实验表明,用户画像记忆提升第 0 轮 persona 对齐,工具记忆提升诊断 matched-pair 比较中的局部修改可靠性,工作记忆支持会话级偏好承接。
相关工作¶
幻灯片生成¶
演示文稿生成已经从文档压缩和结构化摘要发展到基于 LLM 的系统,强调受众适配、可编辑性、任务时偏好推断和视觉优化。这些工作提升了幻灯片质量、可控布局、任务级控制和视觉构图。本文关注的是互补问题:用户特定偏好和执行记忆应该如何跨 slide generation 与 revision session 持久存在,而不是只作为当前任务输入提供。
记忆与工具使用 Agent¶
检索增强和外部记忆语言模型表明,存储上下文可以支持生成。Agent memory 研究关注持久记忆、反思、结构化更新以及长短期记忆管理。工具使用和反思型 agent 则建立了推理与行动交替、API/模块化工具调用、执行协调和从反馈中学习的范式。与这些通用设置不同,MemSlides 面向个性化演示文稿创作,其中记忆必须区分用户偏好和执行经验,并在多轮修改中保持预期的局部编辑范围。
个性化生成与评估¶
个性化生成从显式 persona conditioning 发展到 profile-aware 和 history-aware generation。相关综述与对齐工作把个性化描述为一个 agentic、retrieval-aware、preference-sensitive 的问题。在视觉领域,个性化可视化推荐和 DesignPref 表明,用户历史可以学习持久表达偏好或设计偏好。在 PPT 生成中,Persona-Aware-D2S 和 SlideTailor 通过当前任务提供的受众规格、示例或模板来个性化 slides;本文研究的是跨任务积累并在多轮修改中保留的偏好。
MemSlides¶
问题形式化¶
本文把个性化演示文稿生成建模为有状态的多轮创作问题,而不是一次性的 source-to-slides 转换。给定源材料 $x$、用户画像记忆 $P_u$ 和可选任务时模板 $\tau$,系统首先生成初始 deck:
$$ S_0 = G_{\mathrm{init}}(x, P_u, \tau). $$
本文把这个初始生成阶段称为 round-0。在第 $t$ 轮修改中,系统收到用户反馈 $f_t$ 后,更新会话状态 $z_t$,并相应编辑当前 deck:
$$ z_t = U(z_{t-1}, f_t; S_{t-1}), \qquad S_t = G_{\mathrm{edit}}(S_{t-1}, x, P_u, \tau, z_t), \quad t \ge 1. $$
其中,$z_t$ 存储当前创作会话中仍然活跃的反馈约束和编辑意图。目标不仅是改善第一版草稿,还要在保留已对齐 slides 的同时,让 deck 逐步接近用户意图。
这个形式化区分了三类生命周期不同的个性化信号:
- 用户画像记忆 $P_u$:捕捉跨 job 重复出现的偏好,如主题、视觉风格、布局习惯、内容密度和通用设计规范。
- 任务时模板 $\tau$:如果提供,则作为当前 job 的 deck-local 设计约束。
- 会话状态 $z_t$:捕捉临时的、轮次特定的要求,如“新 slide 标题改成某种颜色”或“某节之后压缩文字”。
当这些信号冲突时,当前 deck 的显式会话反馈优先级最高,其次是任务时模板,最后是用户画像记忆。
多轮局部修改执行¶
图 2: MemSlides 中的局部修改执行。Plan 构建执行契约,Act 应用最小有效编辑,Guard 在最终化局部更新前验证覆盖。
Plan。 MemSlides 把每个修改请求转换成显式执行契约,而不是把范围控制隐含在 prompt 中。契约记录推断出的 scope、目标 slide 路径、活跃规则 ID、selector hint,以及是否需要目标覆盖。局部请求绑定到解析出的 slide;deck-level 规则扩展到所有 slides;混合请求同时保留全局规则和局部例外。由插入请求创建的 future-only 规则不会错误地强制应用到现有 slides,从而避免把结构性编辑变成不必要的全 deck 重写。
Act。 执行器根据契约和可用 slide 结构选择编辑工具。如果目标 slides 共享显式 selector,优先使用 batch CSS update;如果变化目标是跨结构不同 slides 的通用语义,如标题、正文、页脚,则使用 semantic batch styling;如果单个现有 slide 需要内容或局部结构变化,则读取 layout-first repair surface,并对快照目标或暴露规则应用非空 patch 操作。插入和删除页仍然是显式 page-level 操作;整页重写仅限于新 slides,或状态损坏/不可检查后的受控恢复。
Guard。 协议把完成视为经过检查的状态,而不是模型自行决定停止。Patch 调用绑定到快照内容 hash;过期快照触发重新绑定提示,而不是立即全量重写;每个 patch 都必须指定来自 repair candidates、rules 或 targets 的具体操作。当需要覆盖时,过早 finalize 会被阻止,直到所有目标 slides 被修改或明确确认符合要求。这些 guard 让局部修改成为受约束的执行过程:agent 可以更新预期 deck 区域,同时减少重复上下文化、失控范围扩展和已对齐 slides 的漂移。
工作记忆是让 Plan-Act-Guard 具备多轮能力的会话级状态层。它存储早先反馈中的活跃临时偏好、当前 deck 内仍然有效的承接指令,以及已解析目标、覆盖状态、快照重绑定提示等编辑状态记录。它还在可迁移经验被合并到长期工具记忆之前,缓存 round-level tool-memory signals。Plan 读取这些状态来构建执行契约;Act 用它限制编辑区域;Guard 在验证或重绑定后更新它。
用于个性化的用户画像记忆¶
用户画像记忆控制 MemSlides 中的个性化。系统不把个性化当作静态 prompt 前缀,而是表示为持久用户 profile 加当前会话活跃临时记忆:
$$ \mathcal{M}^{\mathrm{pref}}_t = \big(P_u, A_t\big), $$
其中 $P_u$ 是用户 $u$ 的长期 profile,$A_t$ 是第 $t$ 轮修改时的活跃临时记忆。存储的 profile items 按 intent 和 presentation dimensions 组织,只有调和后的子集进入 $A_t$。
图 3: 用户画像记忆生命周期。profile memory 不是静态注入的 prompt block,而是在 round-0 和后续 revision 中被选择、与当前请求调和、使用,并在 job 结束后更新。
在 round-0 生成之前,MemSlides 选择当前 intent $i_0$ 对应的 profile bucket,从请求 $q_0$ 中抽取约束,并将兼容项路由到工作记忆:
$$ \begin{aligned} \tilde P_u = \mathcal{S}!\left(P_u, i_0\right), \qquad C_0 = \mathcal{E}!\left(q_0\right), \qquad A_0 = \mathcal{R}!\left(\tilde P_u, C_0\right). \end{aligned} $$
其中,$\mathcal{S}$ 检索与 intent 匹配的 profile bucket,$\mathcal{E}$ 抽取请求约束,$\mathcal{R}$ 调和两者。显式请求冲突会在当前 deck 中覆盖对应 profile item;兼容偏好则共存为 active memory。
修改过程中,活跃临时记忆随反馈演化:
$$ A_t = \mathcal{U}!\left(A_{t-1}, r_t\right), $$
其中 $r_t$ 是第 $t$ 轮修改请求。更新算子 $\mathcal{U}$ 追加新暴露的偏好,覆盖真实冲突,并保留非冲突项供后续轮次使用。
job 结束时,长期用户画像记忆通过 consolidation 更新,而不是直接把每个临时项都提升为长期偏好:
$$ P_u^{+} = \mathcal{C}!\left(P_u, H\right), $$
其中 $H$ 表示当前 job 中的用户消息,$\mathcal{C}$ 是 intent-aware profile consolidation。这样可以避免把一次性请求存成持久偏好,同时让稳定、可迁移信号改善未来个性化。
用于可靠编辑的工具记忆¶
工具记忆解决个性化编辑的执行侧问题。即使目标偏好正确,agent 仍可能重复无效尝试或反复触发已知工具误用。MemSlides 中被记住的执行单元绑定到 slide-edit scope 和 verification,而不是原始交互历史。
工具记忆按两个执行流组织,匹配局部编辑的时间粒度。Round-scope task experience 在 modify job 开始时可用,并在后续 modify rounds 中缓存于工作记忆;每轮结束后,agent lessons、tool-error summaries 和自动抽取的 patterns 可以更新这一经验池。Operation-scope tool-chain experience 更细粒度:原始 reasoning-tool-observation chains 被切分为可复用 chain fragments,按 operation context 索引,并在未来类似工具调用前检索注入。
图 4: MemSlides 中的工具记忆流。
第 $t$ 轮修改和第 $k$ 个 operation 的执行支持表示为:
$$ \mathcal{M}^{\mathrm{tool}}{t,k} = \big(E_t^{\mathrm{round}}, E\big), $$}^{\mathrm{op}
其中 $E_t^{\mathrm{round}}$ 表示 round-scope execution experience,$E_{t,k}^{\mathrm{op}}$ 表示第 $k$ 个 operation 的 operation-scope tool-chain experience。工具记忆不定义 deck 应该长什么样;它帮助 agent 以更少重复错误、更少回溯和更可靠局部验证来执行目标。可迁移经验在 job 结束时合并到长期工具记忆中。
实验¶
本文评估 MemSlides 是否提升个性化演示文稿生成和多轮局部修改。主文报告三类结果:受控多 persona、多 intent profile bank 上的个性化结果;同一批 decks 上 DeepPresenter 风格的一般质量检查;以及用于局部修改的诊断 matched-pair modify evaluation。
主要结果:个性化¶
用户画像记忆提升 round-0 persona alignment。persona-alignment judgments 显示,在 GLM-5 和 Gemini 3.1 Pro 上,MemSlides 在所有列上都优于两个 baseline。使用 GPT-5 时,MemSlides 在 Content、Structure、Specificity 上优于 SlideTailor,在 Content、Visual、Specificity 上优于 DeepPresenter,但 DeepPresenter 的 Structure 略高。
表 1: 首轮生成的 persona-alignment judgments。分数为三类 persona 平均,0-10 分,越高越好。
| Framework | Model | Content ↑ | Structure ↑ | Visual ↑ | Specificity ↑ |
|---|---|---|---|---|---|
| DeepPresenter | GPT-5 | 6.22 | 7.56 | 5.76 | 5.89 |
| DeepPresenter | GLM-5 | 6.67 | 7.61 | 5.28 | 7.22 |
| DeepPresenter | Gemini 3.1 Pro | 6.89 | 8.00 | 6.78 | 7.44 |
| SlideTailor | GPT-5 | 6.78 | 6.00 | 6.39 | 6.33 |
| SlideTailor | GLM-5 | 4.44 | 4.89 | 4.00 | 3.89 |
| SlideTailor | Gemini 3.1 Pro | 4.48 | 5.00 | 4.03 | 4.67 |
| MemSlides | GPT-5 | 7.11 | 7.33 | 6.00 | 6.67 |
| MemSlides | GLM-5 | 9.00 | 8.78 | 8.56 | 8.89 |
| MemSlides | Gemini 3.1 Pro | 7.77 | 8.64 | 8.24 | 8.56 |
在同一批生成 decks 上,DeepPresenter-style quality metrics 检查 persona gains 是否仍与普通演示文稿质量兼容。结果显示,MemSlides 在提升个性化对齐的同时,保持了有竞争力的 PPT 生成质量。
表 2: 共享三 profile suite 上的一般质量评估。Constraint、Content、Style、Avg. 使用 1-5 分;Diversity 是基于 deck-level DINOv2 embeddings 的 normalized Vendi score。
| Framework | Model | Constraint ↑ | Content ↑ | Style ↑ | Avg. ↑ | Diversity ↑ |
|---|---|---|---|---|---|---|
| DeepPresenter | GPT-5 | 4.83 | 3.50 | 3.63 | 3.99 | 0.387 |
| DeepPresenter | Gemini 3.1 Pro | 4.17 | 3.33 | 4.00 | 3.83 | 0.370 |
| DeepPresenter | GLM-5 | 4.00 | 3.57 | 4.00 | 3.86 | 0.366 |
| SlideTailor | GPT-5 | 3.83 | 2.93 | 4.03 | 3.60 | 0.399 |
| SlideTailor | Gemini 3.1 Pro | 3.83 | 3.20 | 4.00 | 3.68 | 0.364 |
| SlideTailor | GLM-5 | 3.83 | 2.97 | 4.00 | 3.60 | 0.348 |
| MemSlides | GPT-5 | 5.00 | 3.60 | 3.90 | 4.17 | 0.380 |
| MemSlides | Gemini 3.1 Pro | 3.33 | 3.37 | 4.10 | 3.60 | 0.463 |
| MemSlides | GLM-5 | 3.83 | 3.34 | 4.03 | 3.74 | 0.391 |
主要结果:局部修改¶
在诊断 matched-pair modify setting 中,工具记忆注入带来更强的闭环完成和编辑后验证,同时减少首次正确编辑时间和 core tool time。每个 matched pair 只改变是否注入工具记忆,因此这些过程收益支持工具记忆路径对可靠多轮修改的作用。
表 3: 九个诊断 modify pairs 上的工具记忆消融。Completion 和 verification 越高越好;time 和 ratio 越低越好。
| Model | Memory Injected | Closed-Loop Completion ↑ | Strict Verify ↑ | First Correct Edit (s) ↓ | Core Tool Time Ratio ↓ |
|---|---|---|---|---|---|
| GPT-5 | yes | 1.000 | 0.646 | 211.3 | 0.740x |
| GPT-5 | no | 0.667 | 0.294 | 234.2 | 1.000x |
| GLM-5 | yes | 1.000 | 0.488 | 195.9 | 0.344x |
| GLM-5 | no | 0.889 | 0.434 | 500.9 | 1.000x |
| Gemini 3.1 Pro | yes | 0.889 | 0.469 | 309.9 | 0.137x |
| Gemini 3.1 Pro | no | 0.889 | 0.201 | 968.2 | 1.000x |
| Overall | yes | 0.963 | 0.534 | 242.5 | 0.327x |
| Overall | no | 0.815 | 0.310 | 609.5 | 1.000x |
图 5: 局部修改执行定性示例。
分析与讨论¶
用户画像记忆带来广泛而非边缘的对齐收益。 表 1 展示了跨模型族一致但不完全均匀的模式。GLM-5 和 Gemini 3.1 Pro 下,MemSlides 在四个 persona-alignment 维度上均领先两个 baseline。GPT-5 下,收益主要体现在 Content 和 Specificity,而两个 baseline 在 Structure 或 Visual 上保留局部优势。跨模型族平均,MemSlides 相对 DeepPresenter 在 Content、Structure、Visual、Specificity 上分别提升 1.37、0.53、1.66、1.19 分;相对 SlideTailor 分别提升 2.73、2.95、2.79、3.08 分。
这些收益是 planning-level persona gains。 最强证据来自 Structure 和 Specificity 的共同提升。Structure 不包含模板检索准确性,Specificity 使用 distractor personas;而且 judge 看不到原始 prompt 或解析出的 intent。因此提升不能简单解释为更好的模板匹配或通用视觉润色,而说明路由后的长期 profile 帮助系统在 round-0 generation 之前决定页面角色、顺序、布局适配、证据重点和 persona-distinct framing。
Persona gains 与一般 deck 质量兼容。 表 2 表明,MemSlides 在 GPT-5 上取得最佳 Avg.,在 GLM-5 上保持竞争力;Gemini 3.1 Pro 下 Style 和 Diversity 最好但 Constraint 较低。这些结果并不声称每个质量指标都一致领先,而是说明表 1 中的 persona-alignment 提升不是以普通演示文稿质量下降为代价。
图 6: 跨 job profile consolidation 定性案例。
局部修改应同时评价 locality 和 success。 图 5 展示了 modify setting 背后的定性差异:系统可以满足请求变化,但仍然触碰非目标区域;MemSlides 让 patch 更接近请求元素。因此,局部修改指标需要和闭环完成、验证、core-tool-time 效率等过程约束配套。
工具记忆提升整体可靠性和搜索效率,但不是每个 pair 都赢。 在诊断 matched-pair modify setting 中,工具记忆注入将整体 Closed-Loop Completion 从 0.815 提升到 0.963,将 Strict Verify 从 0.310 提升到 0.534;Time to First Correct Edit 从 609.5s 降到 242.5s;Core Tool Time Ratio 的几何平均降到 0.327x。pair-level 计数也很重要:一个 Gemini hard-modify pair 在 Closed-Loop Completion 上失败,两个 pair 在首次编辑延迟上失败,一个 GPT-5 pair 消耗更多 core tool time。这些过程指标整体上更符合受约束局部编辑模式,而不是反复全 deck 重新生成或广泛探索式编辑。
结论¶
本文提出 MemSlides,一个面向个性化演示文稿生成的层次化记忆框架。通过区分用户画像记忆、活跃临时记忆和工具记忆,MemSlides 支持 round-0 persona alignment 和多轮局部修改。受控实验显示,它提升了 persona alignment,并在局部修改可靠性上带来诊断性收益。
局限¶
本文证据范围限于受控 persona-alignment judgments、诊断 matched-pair modify settings 和定性 working-memory cases。Profile bank 和编辑请求是代理任务,而不是真实用户部署研究。未来工作应增加更广泛的人类研究、随机化编辑集合,以及更强的记忆同意、删除和敏感偏好保护机制。
附录要点¶
评估协议¶
Profile-memory evaluation 以完整 round-0 decks 为 judging unit。评估前,每个候选 deck 被渲染为页面对齐图像,并分配匿名 arm label。Judge 只看到目标 persona summary、对齐后的 deck images 和维度 rubric;原始用户 prompt、解析 intent、系统身份和 memory condition 都被隐藏。每个 persona-alignment 维度获得三次 blind votes,先在匿名 arm label 下聚合,再映射回系统。
Persona-alignment judgments 报告四个 0-10 维度:
- Content:内容选择、证据类型、重点和措辞是否匹配目标 persona。
- Structure:页面顺序和页面类型/布局是否反映 persona-conditioned deck organization;不包含模板匹配。
- Visual:信息密度、留白、图表/卡片/diagram 风格、视觉层级和整体视觉语气。
- Specificity:用 distractor personas 测试 deck 是否可识别为目标 persona,而不是泛化的专业演示。
Tool-memory protocol 把局部多轮修改评估为 paired agent executions。每个 pair 固定源 deck、模型族、persona 和 modify request;比较条件仅为是否注入 tool memory。过程指标来自执行 traces,包括编辑完成、变更后验证、finalization、首次正确编辑时间和 core tool time。
Profile Bank¶
论文构建了 30 条长期个性化 profile bank,覆盖 10 类 persona 与每类 3 个 role-intent bucket。Persona 包括教师、软件开发者、管理分析师、营销经理、平面设计师、培训发展专家、财务经理、运营经理、医疗健康服务管理者和立法者。每条 profile 用结构化字段描述布局、内容、视觉和模板偏好,例如软件开发者在 architecture walkthrough 中偏好 overview/architecture diagram、module structure、data flow、design trade-offs 和 experimental evidence;运营经理偏好流程图、时间线、看板和责任矩阵;医疗健康服务管理者偏好指标 dashboard、临床路径图和风险面板。
GPT Profile-Memory 细节¶
附录报告了 GPT 下 MemSlides 与 DeepPresenter 的逐 persona 对比。10 个 persona 平均上,MemSlides 的 Overall 为 7.70,DeepPresenter 为 5.28,差值 +2.42;Content 差值 +3.30,Structure +2.30,Visual +3.17,Specificity +2.43。个别 persona 上也存在例外,例如 Software developer 的 Structure 和 Visual 上 DeepPresenter 更高,Medical health services manager 的 Overall 和 Visual 上 DeepPresenter 略高。
Paired Robustness¶
工具记忆 matched-pair 的稳健性检查如下:
| Metric | W-L-T-NA | Valid W/L | Sign-test p | Interpretation |
|---|---|---|---|---|
| Closed-Loop Completion ↑ | 3-1-5-0 | 4 | 0.3125 | Directional |
| Strict Verify ↑ | 8-1-0-0 | 9 | 0.0195 | Paired evidence |
| First Correct Edit (s) ↓ | 6-2-0-1 | 8 | 0.1445 | Directional |
| Core Tool Time Ratio ↓ | 8-1-0-0 | 9 | 0.0195 | Paired evidence |
更广泛影响与负责任使用¶
论文指出,个性化演示文稿 agent 如果部署到真实用户环境,需要重视记忆治理:用户应能理解哪些偏好被保存、如何删除或更正;系统应避免把一次性或敏感请求长期固化为 profile;同时要处理专业场景中可能出现的偏见、隐私、合规和误导性视觉表达风险。