跳转至

MemSlides:面向个性化幻灯片生成与多轮局部修改的层次化记忆驱动 Agent 框架

作者: Ye Jin, Yangyang Xu, Jun Zhu, Yibo Yang。

机构: 北京邮电大学、清华大学、上海交通大学。

版本: arXiv:2606.17162v1,2026-06-15。

来源: 基于 arXiv LaTeX source source/main.texsections/tables/ 翻译整理。

译注:本文保留关键公式、图注、表格和实验数字,便于追溯。附录中超长 profile bank 与部分逐样例明细未逐行全量翻译,已保留核心协议、结论和主要表格。

摘要

个性化演示文稿生成不能只依赖当前 prompt 或当前模板。Agent 需要在不同任务之间保留稳定的用户偏好,在多轮修改中记住新引入的偏好和约束,并可靠执行局部编辑。本文提出 MemSlides,一个面向个性化演示文稿 Agent 的层次化记忆框架。它把长期记忆和工作记忆分开,并进一步把长期记忆划分为用户画像记忆和工具记忆。用户画像记忆存储与意图相关的用户 profile,用于第 0 轮个性化生成;工作记忆在多轮修改中携带当前活跃偏好和会话约束;工具记忆保存可复用的执行经验,用于可靠的局部编辑。

MemSlides 将这种记忆设计与受限的幻灯片局部修改结合起来:目标更新作用于最小受影响区域,而不是反复重新生成整套幻灯片。在受控实验中,用户画像记忆提升了多 persona、多 intent profile bank 上的 persona 对齐判断;工具记忆注入提升了诊断性 matched-pair 设置中的闭环修改行为;定性案例展示了工作记忆承接偏好的能力。总体而言,这些结果说明,有效的个性化演示文稿创作依赖于区分持久用户画像、会话级工作记忆和跨生成/局部修改可复用的执行经验。

引言

自动演示文稿生成旨在把用户请求转化为结构化 slide deck。由于幻灯片广泛用于教学、汇报、商务和研究交流,而高质量制作仍然耗时且认知负担高,这一方向受到越来越多关注。近期 agentic 系统通过多模态或工具化 workflow 进一步推进了该任务,已经能够生成完整且视觉效果较好的 deck。

但这些系统仍缺少持久个性化。这对生成可直接使用的幻灯片很关键,因为用户在领域、目的、风格和演示习惯上差异很大。例如,同一个用户在做学术报告和商务汇报时,可能偏好不同的布局、模板和表达方式。有效的个性化 slide generation 框架应当跨任务构建并维护用户 profile,捕捉用户在组织、样式和修改方面的长期偏好,而不是要求用户每次交互都重复说明。

已有工作逐步扩展了演示文稿生成能力。PPTAgent 将生成与演示文稿特定评估结合起来;DeepPresenter 引入环境 grounded reflection;SlideTailor 通过参考 slides 和任务时模板进行个性化科学幻灯片生成。但这些方法要么主要提升通用生成和 agentic refinement,要么把个性化绑定到当前输入样例或模板条件,而不是积累出的用户 profile。

因此,本文指出一个核心缺口:现有 slide generation agent 还缺少面向用户的多轮对话过程,能够把修改请求转化成可复用的偏好记忆,并在后续轮次中保持局部修改约束。

MemSlides 总览。框架包含长期记忆和工作记忆。长期记忆保存用户画像记忆和工具记忆,用于持久个性化与可复用执行经验;工作记忆保存当前会话状态,用于个性化生成和局部修改。

图 1: MemSlides 总览。第 $t$ 轮中,$s_t$ 是当前会话状态,$f_t$ 是用户反馈,$s_{t+1}$ 是经过 Modify Exec 后的更新状态。

这个缺口有两个根源。第一,演示文稿创作中的个性化常常通过修改过程逐步暴露,而不是在生成前一次性完整说明。但现有 agent 仍常通过重新上下文化或重新生成 deck 大部分内容来处理编辑。于是,小修改必须与 deck 状态和反馈历史竞争有限上下文,导致多轮局部修改脆弱。第二,现有系统主要改进工作流、工具和评估器,却仍把个性化当作 prompt 的隐式副产物,而不是通过显式记忆设计提供的核心能力。

为解决这些问题,MemSlides 引入 scoped slide locality 作为多轮 slide editing 的修改策略。它不在每轮反馈中重新读取或重写整套 deck,而是把请求投射到最小受影响的 slide 区域,在有边界的 repair surface 上操作。系统只读取该局部区域的结构化快照,包括局部布局结构、可用 selector 和暴露的样式规则;写回时也只生成作用于显式 selector 或这些样式规则的 patch。这样,读写都在结构上保持局部,减少上下文压力和非目标漂移,同时保留已经对齐的内容。

在此基础上,MemSlides 进一步整合层次化记忆框架。该框架有两层:长期记忆和工作记忆。工作记忆维护当前会话状态和跨修改轮次的临时反馈,使后续局部编辑能够保持同一 deck 内仍然有效的临时记忆。长期记忆跨 job 持久存在,并进一步分为用户画像记忆和工具记忆。用户画像记忆是用户特定且意图感知的:对每个用户和每种意图,偏好按主题、内容、视觉、布局、模板、通用习惯等维度组织,并在每个 job 开始时路由到工作记忆。工具记忆捕捉可复用的执行经验,用于后续编辑。

本文贡献有三点:

  • 提出 MemSlides,一个支持多轮局部修改的个性化演示文稿 Agent。它维护会话状态,并用目标 slide 级更新替代反复全 deck 重新生成,为从修改反馈中学习用户偏好提供交互基础。
  • 提出由长期记忆和工作记忆构成的层次化记忆框架。长期记忆包含用户画像记忆和工具记忆,使稳定用户偏好和可复用执行经验可以跨 job 持久保存;工作记忆跟踪会话特定约束。
  • 构建用于个性化演示文稿生成评估的多 persona、多 intent 用户 profile bank。实验表明,用户画像记忆提升第 0 轮 persona 对齐,工具记忆提升诊断 matched-pair 比较中的局部修改可靠性,工作记忆支持会话级偏好承接。

相关工作

幻灯片生成

演示文稿生成已经从文档压缩和结构化摘要发展到基于 LLM 的系统,强调受众适配、可编辑性、任务时偏好推断和视觉优化。这些工作提升了幻灯片质量、可控布局、任务级控制和视觉构图。本文关注的是互补问题:用户特定偏好和执行记忆应该如何跨 slide generation 与 revision session 持久存在,而不是只作为当前任务输入提供。

记忆与工具使用 Agent

检索增强和外部记忆语言模型表明,存储上下文可以支持生成。Agent memory 研究关注持久记忆、反思、结构化更新以及长短期记忆管理。工具使用和反思型 agent 则建立了推理与行动交替、API/模块化工具调用、执行协调和从反馈中学习的范式。与这些通用设置不同,MemSlides 面向个性化演示文稿创作,其中记忆必须区分用户偏好和执行经验,并在多轮修改中保持预期的局部编辑范围。

个性化生成与评估

个性化生成从显式 persona conditioning 发展到 profile-aware 和 history-aware generation。相关综述与对齐工作把个性化描述为一个 agentic、retrieval-aware、preference-sensitive 的问题。在视觉领域,个性化可视化推荐和 DesignPref 表明,用户历史可以学习持久表达偏好或设计偏好。在 PPT 生成中,Persona-Aware-D2S 和 SlideTailor 通过当前任务提供的受众规格、示例或模板来个性化 slides;本文研究的是跨任务积累并在多轮修改中保留的偏好。

MemSlides

问题形式化

本文把个性化演示文稿生成建模为有状态的多轮创作问题,而不是一次性的 source-to-slides 转换。给定源材料 $x$、用户画像记忆 $P_u$ 和可选任务时模板 $\tau$,系统首先生成初始 deck:

$$ S_0 = G_{\mathrm{init}}(x, P_u, \tau). $$

本文把这个初始生成阶段称为 round-0。在第 $t$ 轮修改中,系统收到用户反馈 $f_t$ 后,更新会话状态 $z_t$,并相应编辑当前 deck:

$$ z_t = U(z_{t-1}, f_t; S_{t-1}), \qquad S_t = G_{\mathrm{edit}}(S_{t-1}, x, P_u, \tau, z_t), \quad t \ge 1. $$

其中,$z_t$ 存储当前创作会话中仍然活跃的反馈约束和编辑意图。目标不仅是改善第一版草稿,还要在保留已对齐 slides 的同时,让 deck 逐步接近用户意图。

这个形式化区分了三类生命周期不同的个性化信号:

  • 用户画像记忆 $P_u$:捕捉跨 job 重复出现的偏好,如主题、视觉风格、布局习惯、内容密度和通用设计规范。
  • 任务时模板 $\tau$:如果提供,则作为当前 job 的 deck-local 设计约束。
  • 会话状态 $z_t$:捕捉临时的、轮次特定的要求,如“新 slide 标题改成某种颜色”或“某节之后压缩文字”。

当这些信号冲突时,当前 deck 的显式会话反馈优先级最高,其次是任务时模板,最后是用户画像记忆。

多轮局部修改执行

MemSlides 中的局部修改执行。工作记忆向 Plan-Act-Guard pipeline 提供活跃临时偏好、承接指令、当前编辑状态和工具记忆信号。

图 2: MemSlides 中的局部修改执行。Plan 构建执行契约,Act 应用最小有效编辑,Guard 在最终化局部更新前验证覆盖。

Plan。 MemSlides 把每个修改请求转换成显式执行契约,而不是把范围控制隐含在 prompt 中。契约记录推断出的 scope、目标 slide 路径、活跃规则 ID、selector hint,以及是否需要目标覆盖。局部请求绑定到解析出的 slide;deck-level 规则扩展到所有 slides;混合请求同时保留全局规则和局部例外。由插入请求创建的 future-only 规则不会错误地强制应用到现有 slides,从而避免把结构性编辑变成不必要的全 deck 重写。

Act。 执行器根据契约和可用 slide 结构选择编辑工具。如果目标 slides 共享显式 selector,优先使用 batch CSS update;如果变化目标是跨结构不同 slides 的通用语义,如标题、正文、页脚,则使用 semantic batch styling;如果单个现有 slide 需要内容或局部结构变化,则读取 layout-first repair surface,并对快照目标或暴露规则应用非空 patch 操作。插入和删除页仍然是显式 page-level 操作;整页重写仅限于新 slides,或状态损坏/不可检查后的受控恢复。

Guard。 协议把完成视为经过检查的状态,而不是模型自行决定停止。Patch 调用绑定到快照内容 hash;过期快照触发重新绑定提示,而不是立即全量重写;每个 patch 都必须指定来自 repair candidates、rules 或 targets 的具体操作。当需要覆盖时,过早 finalize 会被阻止,直到所有目标 slides 被修改或明确确认符合要求。这些 guard 让局部修改成为受约束的执行过程:agent 可以更新预期 deck 区域,同时减少重复上下文化、失控范围扩展和已对齐 slides 的漂移。

工作记忆是让 Plan-Act-Guard 具备多轮能力的会话级状态层。它存储早先反馈中的活跃临时偏好、当前 deck 内仍然有效的承接指令,以及已解析目标、覆盖状态、快照重绑定提示等编辑状态记录。它还在可迁移经验被合并到长期工具记忆之前,缓存 round-level tool-memory signals。Plan 读取这些状态来构建执行契约;Act 用它限制编辑区域;Guard 在验证或重绑定后更新它。

用于个性化的用户画像记忆

用户画像记忆控制 MemSlides 中的个性化。系统不把个性化当作静态 prompt 前缀,而是表示为持久用户 profile 加当前会话活跃临时记忆:

$$ \mathcal{M}^{\mathrm{pref}}_t = \big(P_u, A_t\big), $$

其中 $P_u$ 是用户 $u$ 的长期 profile,$A_t$ 是第 $t$ 轮修改时的活跃临时记忆。存储的 profile items 按 intent 和 presentation dimensions 组织,只有调和后的子集进入 $A_t$。

用户画像记忆生命周期。长期记忆存储跨 job 积累的 intent-conditioned user profile memory。job 开始时,根据当前请求把兼容偏好路由到 active temporary memory;job 结束时,把稳定交互信号合并回用户画像记忆。

图 3: 用户画像记忆生命周期。profile memory 不是静态注入的 prompt block,而是在 round-0 和后续 revision 中被选择、与当前请求调和、使用,并在 job 结束后更新。

在 round-0 生成之前,MemSlides 选择当前 intent $i_0$ 对应的 profile bucket,从请求 $q_0$ 中抽取约束,并将兼容项路由到工作记忆:

$$ \begin{aligned} \tilde P_u = \mathcal{S}!\left(P_u, i_0\right), \qquad C_0 = \mathcal{E}!\left(q_0\right), \qquad A_0 = \mathcal{R}!\left(\tilde P_u, C_0\right). \end{aligned} $$

其中,$\mathcal{S}$ 检索与 intent 匹配的 profile bucket,$\mathcal{E}$ 抽取请求约束,$\mathcal{R}$ 调和两者。显式请求冲突会在当前 deck 中覆盖对应 profile item;兼容偏好则共存为 active memory。

修改过程中,活跃临时记忆随反馈演化:

$$ A_t = \mathcal{U}!\left(A_{t-1}, r_t\right), $$

其中 $r_t$ 是第 $t$ 轮修改请求。更新算子 $\mathcal{U}$ 追加新暴露的偏好,覆盖真实冲突,并保留非冲突项供后续轮次使用。

job 结束时,长期用户画像记忆通过 consolidation 更新,而不是直接把每个临时项都提升为长期偏好:

$$ P_u^{+} = \mathcal{C}!\left(P_u, H\right), $$

其中 $H$ 表示当前 job 中的用户消息,$\mathcal{C}$ 是 intent-aware profile consolidation。这样可以避免把一次性请求存成持久偏好,同时让稳定、可迁移信号改善未来个性化。

用于可靠编辑的工具记忆

工具记忆解决个性化编辑的执行侧问题。即使目标偏好正确,agent 仍可能重复无效尝试或反复触发已知工具误用。MemSlides 中被记住的执行单元绑定到 slide-edit scope 和 verification,而不是原始交互历史。

工具记忆按两个执行流组织,匹配局部编辑的时间粒度。Round-scope task experience 在 modify job 开始时可用,并在后续 modify rounds 中缓存于工作记忆;每轮结束后,agent lessons、tool-error summaries 和自动抽取的 patterns 可以更新这一经验池。Operation-scope tool-chain experience 更细粒度:原始 reasoning-tool-observation chains 被切分为可复用 chain fragments,按 operation context 索引,并在未来类似工具调用前检索注入。

工具记忆流。Round-scope task experience 在 job 开始时可用,在 modify rounds 中进入工作记忆,并通过 agent lessons、tool-error summaries 和自动抽取 patterns 更新;operation-scope tool-chain experience 将原始链路记录为紧凑片段,并在相似工具调用前检索注入。

图 4: MemSlides 中的工具记忆流。

第 $t$ 轮修改和第 $k$ 个 operation 的执行支持表示为:

$$ \mathcal{M}^{\mathrm{tool}}{t,k} = \big(E_t^{\mathrm{round}}, E\big), $$}^{\mathrm{op}

其中 $E_t^{\mathrm{round}}$ 表示 round-scope execution experience,$E_{t,k}^{\mathrm{op}}$ 表示第 $k$ 个 operation 的 operation-scope tool-chain experience。工具记忆不定义 deck 应该长什么样;它帮助 agent 以更少重复错误、更少回溯和更可靠局部验证来执行目标。可迁移经验在 job 结束时合并到长期工具记忆中。

实验

本文评估 MemSlides 是否提升个性化演示文稿生成和多轮局部修改。主文报告三类结果:受控多 persona、多 intent profile bank 上的个性化结果;同一批 decks 上 DeepPresenter 风格的一般质量检查;以及用于局部修改的诊断 matched-pair modify evaluation。

主要结果:个性化

用户画像记忆提升 round-0 persona alignment。persona-alignment judgments 显示,在 GLM-5 和 Gemini 3.1 Pro 上,MemSlides 在所有列上都优于两个 baseline。使用 GPT-5 时,MemSlides 在 Content、Structure、Specificity 上优于 SlideTailor,在 Content、Visual、Specificity 上优于 DeepPresenter,但 DeepPresenter 的 Structure 略高。

表 1: 首轮生成的 persona-alignment judgments。分数为三类 persona 平均,0-10 分,越高越好。

Framework Model Content ↑ Structure ↑ Visual ↑ Specificity ↑
DeepPresenter GPT-5 6.22 7.56 5.76 5.89
DeepPresenter GLM-5 6.67 7.61 5.28 7.22
DeepPresenter Gemini 3.1 Pro 6.89 8.00 6.78 7.44
SlideTailor GPT-5 6.78 6.00 6.39 6.33
SlideTailor GLM-5 4.44 4.89 4.00 3.89
SlideTailor Gemini 3.1 Pro 4.48 5.00 4.03 4.67
MemSlides GPT-5 7.11 7.33 6.00 6.67
MemSlides GLM-5 9.00 8.78 8.56 8.89
MemSlides Gemini 3.1 Pro 7.77 8.64 8.24 8.56

在同一批生成 decks 上,DeepPresenter-style quality metrics 检查 persona gains 是否仍与普通演示文稿质量兼容。结果显示,MemSlides 在提升个性化对齐的同时,保持了有竞争力的 PPT 生成质量。

表 2: 共享三 profile suite 上的一般质量评估。Constraint、Content、Style、Avg. 使用 1-5 分;Diversity 是基于 deck-level DINOv2 embeddings 的 normalized Vendi score。

Framework Model Constraint ↑ Content ↑ Style ↑ Avg. ↑ Diversity ↑
DeepPresenter GPT-5 4.83 3.50 3.63 3.99 0.387
DeepPresenter Gemini 3.1 Pro 4.17 3.33 4.00 3.83 0.370
DeepPresenter GLM-5 4.00 3.57 4.00 3.86 0.366
SlideTailor GPT-5 3.83 2.93 4.03 3.60 0.399
SlideTailor Gemini 3.1 Pro 3.83 3.20 4.00 3.68 0.364
SlideTailor GLM-5 3.83 2.97 4.00 3.60 0.348
MemSlides GPT-5 5.00 3.60 3.90 4.17 0.380
MemSlides Gemini 3.1 Pro 3.33 3.37 4.10 3.60 0.463
MemSlides GLM-5 3.83 3.34 4.03 3.74 0.391

主要结果:局部修改

在诊断 matched-pair modify setting 中,工具记忆注入带来更强的闭环完成和编辑后验证,同时减少首次正确编辑时间和 core tool time。每个 matched pair 只改变是否注入工具记忆,因此这些过程收益支持工具记忆路径对可靠多轮修改的作用。

表 3: 九个诊断 modify pairs 上的工具记忆消融。Completion 和 verification 越高越好;time 和 ratio 越低越好。

Model Memory Injected Closed-Loop Completion ↑ Strict Verify ↑ First Correct Edit (s) ↓ Core Tool Time Ratio ↓
GPT-5 yes 1.000 0.646 211.3 0.740x
GPT-5 no 0.667 0.294 234.2 1.000x
GLM-5 yes 1.000 0.488 195.9 0.344x
GLM-5 no 0.889 0.434 500.9 1.000x
Gemini 3.1 Pro yes 0.889 0.469 309.9 0.137x
Gemini 3.1 Pro no 0.889 0.201 968.2 1.000x
Overall yes 0.963 0.534 242.5 0.327x
Overall no 0.815 0.310 609.5 1.000x

局部修改执行的定性示例。面对相同局部编辑请求,DeepPresenter 可能满足目标变化但同时改变 slide 的非目标区域;MemSlides 对请求元素应用目标 patch,保留已经对齐的 slide 内容。

图 5: 局部修改执行定性示例。

分析与讨论

用户画像记忆带来广泛而非边缘的对齐收益。 表 1 展示了跨模型族一致但不完全均匀的模式。GLM-5 和 Gemini 3.1 Pro 下,MemSlides 在四个 persona-alignment 维度上均领先两个 baseline。GPT-5 下,收益主要体现在 Content 和 Specificity,而两个 baseline 在 Structure 或 Visual 上保留局部优势。跨模型族平均,MemSlides 相对 DeepPresenter 在 Content、Structure、Visual、Specificity 上分别提升 1.37、0.53、1.66、1.19 分;相对 SlideTailor 分别提升 2.73、2.95、2.79、3.08 分。

这些收益是 planning-level persona gains。 最强证据来自 Structure 和 Specificity 的共同提升。Structure 不包含模板检索准确性,Specificity 使用 distractor personas;而且 judge 看不到原始 prompt 或解析出的 intent。因此提升不能简单解释为更好的模板匹配或通用视觉润色,而说明路由后的长期 profile 帮助系统在 round-0 generation 之前决定页面角色、顺序、布局适配、证据重点和 persona-distinct framing。

Persona gains 与一般 deck 质量兼容。 表 2 表明,MemSlides 在 GPT-5 上取得最佳 Avg.,在 GLM-5 上保持竞争力;Gemini 3.1 Pro 下 Style 和 Diversity 最好但 Constraint 较低。这些结果并不声称每个质量指标都一致领先,而是说明表 1 中的 persona-alignment 提升不是以普通演示文稿质量下降为代价。

跨 job profile consolidation 的定性示例。六个重复 job 中,局部反馈线索变成可复用 profile preferences,并在后续 job 中作为默认 slide 组织模式重新出现。

图 6: 跨 job profile consolidation 定性案例。

局部修改应同时评价 locality 和 success。 图 5 展示了 modify setting 背后的定性差异:系统可以满足请求变化,但仍然触碰非目标区域;MemSlides 让 patch 更接近请求元素。因此,局部修改指标需要和闭环完成、验证、core-tool-time 效率等过程约束配套。

工具记忆提升整体可靠性和搜索效率,但不是每个 pair 都赢。 在诊断 matched-pair modify setting 中,工具记忆注入将整体 Closed-Loop Completion 从 0.815 提升到 0.963,将 Strict Verify 从 0.310 提升到 0.534;Time to First Correct Edit 从 609.5s 降到 242.5s;Core Tool Time Ratio 的几何平均降到 0.327x。pair-level 计数也很重要:一个 Gemini hard-modify pair 在 Closed-Loop Completion 上失败,两个 pair 在首次编辑延迟上失败,一个 GPT-5 pair 消耗更多 core tool time。这些过程指标整体上更符合受约束局部编辑模式,而不是反复全 deck 重新生成或广泛探索式编辑。

结论

本文提出 MemSlides,一个面向个性化演示文稿生成的层次化记忆框架。通过区分用户画像记忆、活跃临时记忆和工具记忆,MemSlides 支持 round-0 persona alignment 和多轮局部修改。受控实验显示,它提升了 persona alignment,并在局部修改可靠性上带来诊断性收益。

局限

本文证据范围限于受控 persona-alignment judgments、诊断 matched-pair modify settings 和定性 working-memory cases。Profile bank 和编辑请求是代理任务,而不是真实用户部署研究。未来工作应增加更广泛的人类研究、随机化编辑集合,以及更强的记忆同意、删除和敏感偏好保护机制。

附录要点

评估协议

Profile-memory evaluation 以完整 round-0 decks 为 judging unit。评估前,每个候选 deck 被渲染为页面对齐图像,并分配匿名 arm label。Judge 只看到目标 persona summary、对齐后的 deck images 和维度 rubric;原始用户 prompt、解析 intent、系统身份和 memory condition 都被隐藏。每个 persona-alignment 维度获得三次 blind votes,先在匿名 arm label 下聚合,再映射回系统。

Persona-alignment judgments 报告四个 0-10 维度:

  • Content:内容选择、证据类型、重点和措辞是否匹配目标 persona。
  • Structure:页面顺序和页面类型/布局是否反映 persona-conditioned deck organization;不包含模板匹配。
  • Visual:信息密度、留白、图表/卡片/diagram 风格、视觉层级和整体视觉语气。
  • Specificity:用 distractor personas 测试 deck 是否可识别为目标 persona,而不是泛化的专业演示。

Tool-memory protocol 把局部多轮修改评估为 paired agent executions。每个 pair 固定源 deck、模型族、persona 和 modify request;比较条件仅为是否注入 tool memory。过程指标来自执行 traces,包括编辑完成、变更后验证、finalization、首次正确编辑时间和 core tool time。

Profile Bank

论文构建了 30 条长期个性化 profile bank,覆盖 10 类 persona 与每类 3 个 role-intent bucket。Persona 包括教师、软件开发者、管理分析师、营销经理、平面设计师、培训发展专家、财务经理、运营经理、医疗健康服务管理者和立法者。每条 profile 用结构化字段描述布局、内容、视觉和模板偏好,例如软件开发者在 architecture walkthrough 中偏好 overview/architecture diagram、module structure、data flow、design trade-offs 和 experimental evidence;运营经理偏好流程图、时间线、看板和责任矩阵;医疗健康服务管理者偏好指标 dashboard、临床路径图和风险面板。

GPT Profile-Memory 细节

附录报告了 GPT 下 MemSlides 与 DeepPresenter 的逐 persona 对比。10 个 persona 平均上,MemSlides 的 Overall 为 7.70,DeepPresenter 为 5.28,差值 +2.42;Content 差值 +3.30,Structure +2.30,Visual +3.17,Specificity +2.43。个别 persona 上也存在例外,例如 Software developer 的 Structure 和 Visual 上 DeepPresenter 更高,Medical health services manager 的 Overall 和 Visual 上 DeepPresenter 略高。

Paired Robustness

工具记忆 matched-pair 的稳健性检查如下:

Metric W-L-T-NA Valid W/L Sign-test p Interpretation
Closed-Loop Completion ↑ 3-1-5-0 4 0.3125 Directional
Strict Verify ↑ 8-1-0-0 9 0.0195 Paired evidence
First Correct Edit (s) ↓ 6-2-0-1 8 0.1445 Directional
Core Tool Time Ratio ↓ 8-1-0-0 9 0.0195 Paired evidence

更广泛影响与负责任使用

论文指出,个性化演示文稿 agent 如果部署到真实用户环境,需要重视记忆治理:用户应能理解哪些偏好被保存、如何删除或更正;系统应避免把一次性或敏感请求长期固化为 profile;同时要处理专业场景中可能出现的偏见、隐私、合规和误导性视觉表达风险。