MaineCoon:追求实时音视频社交世界模型¶
作者: Catnip AI Team;PDF 元数据列出 Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie。
版本: arXiv:2606.17800v1,2026-06-16;PDF 日期为 2026-06-17。
项目页: https://mainecoon.tech/
来源: 基于 arXiv LaTeX source source/main.tex 翻译整理。
译注:本文保留关键公式、图注和主要实验表格。部分训练公式和附录 qualitative cases 做了可读化压缩,完整英文解析层见
main_en.md。
摘要¶
随着全球视频内容越来越多地在社交平台上被消费,并服务于互动式社交目的,面向社交世界的视频生成模型很重要,但此前研究基本忽视了这一方向。本文定义 social world model 的定位,并构建一个原型模型作为迈向该目标的第一步。
已有 world models 成功模拟物理环境或游戏世界探索,但它们与以人为中心的社交动态存在根本脱节。它们通常省略关键听觉信息,或无法捕捉病毒式社交媒体内容所具有的高参与节奏、情感共鸣和快速对话流。为弥合这一差距,本文提出 MaineCoon,第一个实时音视频自回归模型:它有 22B 参数,支持实时流式生成和亚秒级交互,并能在单张 GPU 上达到最高 47.5 FPS 的帧率。
据作者所知,MaineCoon 也是第一个专门为社交互动应用优化的实时音视频生成模型。为实现高效稳定训练,本文引入 self-resampling、跨模态表征对齐、domain-aware preference optimization 和 reinforced online-policy distillation(ROPD)等技术。本文还设计了第一个 agentic streaming inference 框架,通过 agentic cache management 和 prompt planning 支持千秒级甚至更长生成,同时缓解漂移。这些创新提升了训练效率,并优化实时推理性能。
作者认为,MaineCoon 不仅为高质量、低延迟、长程音视频自回归模型设定了新的 SOTA 性能基准,也指出了下一代 AI-native 社交平台所需的范式转变。
引言¶
生成模型的进展已经从静态图像合成转向动态视频生成,并进一步转向预测场景如何随时间演化的 world models。DiT 已能生成高分辨率 text-to-video 和 image-to-video clips,具备较强视觉保真度和连贯运动。
但传统视频扩散模型仍有两个基础限制:
- 慢且昂贵。 生成视频需要在许多 denoising steps 中反复处理大量时空 tokens,完整 self-attention 的计算和显存成本随视频长度和分辨率迅速增长。
- 不是实时的。 传统模型通常在双向时间注意力下联合 denoise 整个 clip,生成过程中无法 finalize 和 emit 中间帧。因此,即使效率技术加快了完整视频生成,也没有从根本上支持 causal streaming generation 或持续用户交互。
为克服双向视频扩散模型的慢和非流式问题,近期工作探索 streaming 和 autoregressive video generation。这些方法顺序生成 frames 或短 chunks,通过 KV-cache 复用历史状态,并常把采样降到少量 steps,从而实现低延迟交互式视频合成。但已有 streaming video generation 仍有三类不足:
- 主要关注视觉生成,省略音频,或仅把音频作为条件,不能联合生成语音、环境声、面部运动及其时间同步。
- 长自回归 rollout 容易受到误差积累和时间漂移影响,分钟级音视频生成仍是开放问题。
- 一些方法声称实时,但无法在单张 GPU 上实时生成,成本仍不足以支持大规模社交互动应用。
这些限制对社交视频尤其关键,因为社交视频的吸引力很大程度依赖人类表情、语音节奏、情感共鸣、对话节奏和快速受众反馈。因此,中心挑战不再只是生成视觉上吸引人的视频,而是构建能低延迟、长程稳定、跨模态同步地参与社交互动的实时音视频生成器。
Social World Model¶
世界上大多数视频内容实际上是在社交平台上观看,并为互动式社交目的创作。近年来 interactive world models 在模拟物理环境和游戏世界探索上取得进展,但它们与消费量最高的视频内容和以人为中心的互动社交目的仍然脱节。
本文提出 social world models:一种为理解、模拟和响应以人为中心的社交动态而设计的生成范式。人类社交互动有自己的“social physics”,即一组高度结构化、多模态的行为规则,模型可以用自回归方式学习这些规则。不同于传统 world models 预测环境转移或物体轨迹,social world model 学习主动观察用户、内部模拟社交动态,并实时响应用户。
完整 social world models 需要主动多模态观察、内部用户状态模拟、记忆、规划和实时音视频生成等能力。本文聚焦这一系统的生成核心:一个大型音视频模型是否能够以原生流式自回归方式生成社交视频,保持语音和视觉运动同步,支持长程 continuation,并仍能在单张 GPU 上实时运行。
MaineCoon 是一个 22B 参数实时社交音视频自回归模型。它在 causal streaming regime 下逐 chunk 生成同步音频和视频,支持亚秒级交互。与离线双向视频生成器不同,MaineCoon 从一开始就围绕部署时 streaming 设计:数据基础设施、训练框架、注意力模式、上下文分布、KV-cache 使用和 agentic streaming inference 都针对实时社交音视频生成优化。
贡献¶
本文主要贡献有五点:
- 构建 22B 实时交互式音视频自回归模型,可流式生成并支持亚秒级交互,在单张 H100 GPU 上最高达到 47.5 FPS;音视频生成成本显著低于每秒 0.001 美元。
- 提出面向社交互动目的的 social world models 范式定位。MaineCoon 作为迈向该范式的第一个生成核心,为下一代 AI-native 社交平台提供技术基础。
- 提出多阶段 forcing-free streaming training 范式,包括 self-resampling、跨模态表征对齐、domain-aware preference optimization 和 ROPD,使 22B 规模原生 streaming 音视频训练成为可能。
- 设计 agentic streaming inference 框架,通过 agentic cache management、chunk commitment、long-context rollout 和 prompt planning 支持千秒级甚至更长生成,并缓解漂移。
- 引入 SocialVideo Bench,一个聚焦社交视频音视频生成的 benchmark。它包含 9 个代表性指标,覆盖视觉质量、运动、音频质量、音视频对齐和社交视频和谐度。实验显示 MaineCoon 显著优于 7 个代表性开放音视频生成模型,同时速度最快。
数据¶
MaineCoon 的 social-video 数据基础设施有四个特点:
- 基于 social-oriented raw data,即强调现场感的短社交视频,而非电影镜头。
- 同时评价视频质量和音视频质量,因为 social world model 必须同步渲染语音、唇动和表情。
- 过滤和标准化流程面向 audio-visual streaming training,包含长程、prompt-switching supervision。
- 数据基础设施本身也是高效流式系统:原始短视频持续从社交平台摄取,经过自动过滤 cascade,转成标准训练 clips,吞吐可达每天 10 万个视频。
什么是好的社交视频¶
社交平台流行视频与多数视频生成模型模仿的 cinematic footage 本质不同。电影视频是被导演安排的,它通过舞台调度、光照和剪辑服务于叙事,因此视觉语言偏向构图、尺度和奇观。社交视频的价值则来自 liveness:让观众立即感到一个真实的人在场、正在关注观众,并在当下做出反应。
这种现场感更多由细粒度人类信号承载:凝视方向和稳定性、微表情、头部和手势、语音时机和韵律、可听情绪。本文认为,好的社交视频应该自然、以人为中心,而不是过度舞台化;它应在语音、唇动和面部表情之间保持紧密同步,并在整个持续时间内保持时间一致和连贯。
数据管线¶
数据管线使用两个互补来源:由强 teacher model 生成的合成音视频,以及从社交媒体短视频中筛选的真实社交视频。合成源用于稳定早期 streaming training,并为 post-training 提供 preference data pairs;真实社交视频构成数据主体。两者最终被标准化为训练就绪的 clips 及其文本、音频和视觉条件,并合并到 domain-balanced training buckets 中。
合成数据管线¶
图 1: 合成音视频数据管线。第一段用 text-to-video 生成,后续段用上一段最后一帧进行 image-to-video,因此一次 rollout 跨越多个 prompt switches。多阶段质量门控只保留高质量 clips,并保存每个 survivor 的完整 sampling trajectory,而不只是最终视频。
合成数据来自 teacher model LTX-2.3,目的不是单纯扩充规模,而是服务 streaming training。Teacher 离线生成固定长度 clips,而将它转换成实时 streaming model 需要 segmented、prompt-switching supervision,原始社交视频并不直接提供这种监督。作者因此生成多 segment stories,使 prompt 在长 streaming rollout 中发生变化。
Scenario planning。 系统先规划一个多 clip 故事,在固定 subject 上发生 prompt switch。Prompt 来自 director-style language-model pipeline,覆盖 10 个主题组、225 个 scenes、15 种 visual styles 和 12 种 camera shots。每个 scenario 拆成三到四个连续 clips,构成约 20 秒故事,建立场景、推进内容并以 reaction 结束。
Segmented generation。 第一段用 text-to-video 生成,后续段使用上一段最终帧作为 image-to-video seed,在 teacher 支持的若干分辨率和帧数 bucket 中生成约 5 秒固定长度 segment。
Quality filtering。 生成 clips 进入综合质量门控。无法解码或无音频的 clips 直接丢弃;其余由四类分析器评分:视频质量、音频质量、音视频同步和 caption quality。再用 Gemini-3.1-flash 作为 vision-language judge 评价采样帧与 caption 的一致性。只有综合分超过阈值的少量 clips 进入数据集。
Training-ready packaging。 每个 survivor 被转成训练记录。系统不只保留最终视频,还缓存完整 sampling trajectory:初始噪声、每步 latents 和 $\mathbf{x}_0$ predictions、noise schedule,以及双模态 text conditioning。这些轨迹用于 consistency 和 step-distillation objectives。
真实数据管线¶
图 2: 真实视频数据管线。低层过滤先探测 source、切成 single-shot windows,并丢弃持续屏幕文字;高层过滤只保留 talking-head windows:SCRFD 丢弃无脸内容,overlapping-speech check 移除多人串话,SyncNet lip-sync verification 保留可见说话人与音频一致的 windows。之后用 Demucs 和 faster-whisper 生成时间对齐语音文本,并把幸存 windows 对齐到生成器帧网格和固定分辨率。
真实视频来自数千万个原始社交媒体视频。管线使用 speech-strict、person-centric cascade,只保留单镜头窗口,且窗口中有清晰可见的人对镜头说话。廉价 rejection 优先执行,使昂贵语音和 lip-sync 模型只处理 survivors。
低层过滤先筛掉帧率、时长、分辨率不合格的 source;TransNetV2 把视频分成 3 到 20 秒 shots;EasyOCR 丢弃带持久屏幕文字的窗口,如字幕、水印等。
高层过滤要求 clips 中只有一个清晰可见的人在镜头前说话。SCRFD face detector 是最有效过滤器,可在昂贵模型运行前丢弃接近一半无可检测人脸候选。之后 overlapping-speech check 用轻量谱 pitch heuristic 去掉多人同时说话片段,SyncNet 验证口型与音频同步。
语音转写阶段先用 Demucs 分离 vocal track,再用 faster-whisper 转写出带起止时间的句子级 segments。编码阶段把每个 survivor 标准化到生成器训练网格。生成器接受帧数形如:
$$ T = 1 + (2k-1)\cdot 8,\quad k\ge 1, $$
即 $T \in {9,25,41,57,\dots}$。每个窗口按短边 480 缩放,并中心裁剪为 $832\times480$ 或 $480\times832$。
Post-training 数据¶
真实语料主要面向 pre-training,但 post-training 需要更有针对性的数据,即从模型最弱的 domains 中采样。社交视频语料高度不均匀:接近镜头、低运动的 talking-head footage 占主导,而 wide-shot、高运动、多人物等困难场景稀少。因此,作者对已过滤 clips 再做 domain classification,得到 domain-balanced set,提升困难 domains 的权重。
SocialVideo Bench¶
SocialVideo Bench 是一个面向代表性社交视频内容的音视频生成 benchmark。它不重新发明指标,而是采用已有视觉质量、运动质量、音频质量、文本-视频对齐和音视频对齐指标,同时构造覆盖七类社交视频的平衡评估集。Benchmark 包含 700 个 prompt pairs,每类 100 个。每个样本包含两个连续 10 秒 segments,并在 10 秒边界更新 prompt,从而评估模型在 prompt change 下的质量、时间一致性和音视频一致性。
表 1:SocialVideo-Bench domain composition。
| Domain | Samples | Representative Content |
|---|---|---|
| Dense Speech | 100 | 连续讲话、旁白、解释、独白 |
| Two-Person Interaction | 100 | 对话、采访、辩论、人际反应 |
| Music and Vocal | 100 | 歌唱、vocal performance、以音乐为中心的人类活动 |
| Emotional Performance | 100 | 表达性讲话、面部情绪、情绪驱动行为 |
| Dance | 100 | 独舞或多人舞蹈,突出节奏性身体运动 |
| Creative Stress Test | 100 | 人类动作、音频事件和复杂场景的创造性组合 |
| Social Memes | 100 | 幽默、反应和叙事反转类社交内容 |
| Total | 700 | 七个平衡社交视频 domains |
训练¶
MaineCoon 是原生 streaming autoregressive audio-visual generator。它不是通过 teacher forcing 从 non-causal teacher 蒸馏 streaming behavior,而是在推理时相同的 chunk-by-chunk causal regime 下直接优化。
训练 recipe 包含四部分:
- native streaming AR training with self-resampling;
- representation alignment,通过 pretrained encoder supervision 加速训练并强化音视频对应;
- domain-aware preference optimization 和 ROPD,把模型适配到异质社交视频 domains,并整合为单一可部署 streaming policy;
- 让 streaming training 高效可行的训练基础设施。
图 3: MaineCoon 训练框架。上述组件使 22B causal audio-visual generator 能在少于 100 万 clips、约 1 万 GPU hours 内训练,同时支持实时流式推理。
Native Streaming AR Training with Self-Resampling¶
核心思想是:每个目标音视频 chunk 不只从干净 ground-truth histories 训练,也从模型自己诱导出的 degraded histories 训练。这些 degraded histories 通过 stop-gradient self-resampling 构造,使模型对长程 streaming deployment 中必然遇到的不完美上下文更鲁棒。
作者把音视频信号表示为同步 chunks 序列:
$$ \mathbf{x}_{1:T}={\mathbf{x}_1,\ldots,\mathbf{x}_T}, \qquad \mathbf{x}_t=(\mathbf{x}_t^{v},\mathbf{x}_t^{a}), $$
其中 $\mathbf{x}_t^{v}$ 和 $\mathbf{x}_t^{a}$ 是第 $t$ 个 chunk 的视觉与音频 latents。序列采用 causal autoregressive factorization:
$$ p_\theta(\mathbf{x}{1:T}\mid\mathbf{c}) =\prod}^{T} p_\theta(\mathbf{xt\mid\mathbf{x}), $$},\mathbf{c
其中 $\mathbf{c}$ 包含文本、语音、场景和社交 domain signals;第 $t$ 个 chunk 只能关注 $\mathbf{x}_{<t}$,不能关注未来音频或视频。
每个 chunk 用 conditional flow-matching 过程生成。对干净目标 chunk $\mathbf{x}_t$、noise level $\tau\in[0,1]$ 和 Gaussian noise $\boldsymbol{\epsilon}$:
$$ \mathbf{z}{t,\tau}=(1-\tau)\,\mathbf{x}_t+\tau\,\boldsymbol{\epsilon}, \qquad \mathbf{u}_t . $$}=\boldsymbol{\epsilon}-\mathbf{x
网络 $f_\theta$ 是 causal audio-visual diffusion transformer,训练目标为:
$$ \mathcal{L}{\mathrm{AR}} =\mathbb{E}!\left[ \left| f_\theta!\left(\mathbf{z}}{t,\tau},\tau,\mathbf{x}\right) -\mathbf{u}_{t,\tau}\right|_2^2 \right]. $$},\mathbf{c
仅使用干净真实 histories 会造成训练-部署上下文分布差距:推理时模型必须依赖自己过去生成的 chunks,身份、运动、音频纹理或音视频同步中的小错误会被反复反馈和放大。
图 4: Audio-visual self-resampling。
Self-resampling 周期性地用与推理相同的 causal interface 和 KV-cache 进行短自回归 rollout。对历史 chunk $j$,先加噪再用单步 Euler 估计 clean chunk:
$$ \begin{aligned} \mathbf{z}{j,\sigma_h} &= (1-\sigma_h)\,\mathbf{x}_j+\sigma_h\,\boldsymbol{\epsilon}_j,\ \hat{\mathbf{x}}_j &= \operatorname{sg}!\big[\,\mathbf{z} -\sigma_h\,f_\theta(\mathbf{z}{j,\sigma_h},\sigma_h,\hat{\mathbf{x}})\,\big]. \end{aligned} $$},\mathbf{c
训练时,每个样本按概率在干净历史和 self-resampled 历史之间选择:
$$ \tilde{\mathbf{x}}{<t}= \begin{cases} \mathbf{x} 1-\rho,\ \hat{\mathbf{x}}_{<t}, & \text{with probability } \rho. \end{cases} $$}, & \text{with probability
对应总体目标为:
$$ \mathcal{L}{\mathrm{native}} =(1-\rho)\,\mathcal{L}. $$}}+\rho\,\mathcal{L}_{\mathrm{SR}
训练采用 curriculum:早期 $\rho$ 小、rollout horizon 短,主要依赖干净 teacher-forced histories,建立局部音视频质量、语音清晰度和唇形同步;随后逐渐增加 $\rho$ 并扩展 rollout horizon,让模型接触更长、更不完美的 self-resampled histories。
Streaming Representation Alignment¶
在 streaming objective 下从头训练大型音视频 diffusion transformer,语义结构形成较慢。Flow-matching loss 主要监督低层重建,对语义组织特征压力弱,连贯运动和音视频对应会较晚出现。作者因此引入基于 V-JEPA 2 的 representation alignment。
对训练 clip,冻结 encoder $g$ 预计算 teacher features:
$$ \mathbf{Y}=g(\text{clip})\in\mathbb{R}^{F\times S\times d_{\mathrm{tea}}}, $$
其中 $F$ 是 latent frames 数,$S$ 是每帧 spatial tokens 数。中间 transformer layers 的 hidden states 通过 projector $P_\ell$ 映射到 teacher space。相比直接回归 feature,作者采用 token relation distillation:对 token features 计算 cosine relation matrix:
$$ R(\mathbf{a})_{mn}=\frac{\mathbf{a}_m^{\top}\mathbf{a}_n}{|\mathbf{a}_m|_2\,|\mathbf{a}_n|_2}. $$
然后用 margin-clamped error 匹配 student 和 teacher 的 token relation:
$$ \ell_{\mathrm{TRD}}!\big(\hat{\mathbf{Y}},\mathbf{Y}\big) =\frac{1}{N^2}\sum_{m,n=1}^{N} \operatorname{ReLU}!\Big(\big|R(\hat{\mathbf{Y}}){mn}-R(\mathbf{Y})\big|-\gamma\Big). $$
完整训练目标为:
$$ \mathcal{L}=\mathcal{L}{\mathrm{native}}+\lambda. $$}}\,\mathcal{L}_{\mathrm{align}
Teacher 冻结且 features 预计算,因此训练时不增加 teacher forward pass。对齐只施加到 visual target half,不作用于 no-gradient self-resampling rollout。作者认为,这能让模型更快形成语义组织特征,减少达到连贯运动和音视频对应所需训练步数。
Posttraining:Multi-domain DPO 与 ROPD¶
社交视频各 domain 的质量标准差异很大:far-shot 需要稳定全身结构,multi-person dialogue 需要说话者身份和 turn-taking,一些舞蹈/高运动视频需要大幅度、时间连贯的身体运动。直接把所有目标放进一个模型优化可能产生冲突信号。因此作者采用 specialize-then-consolidate 策略:先构造 domain-specific preference pairs,训练一组轻量 DPO experts,再通过 ROPD 整合到一个统一 streaming policy。
作者至少考虑五个困难 domains:far shot、multi-person dialogue、motion、animation、dance。对每个 domain $d$,用 domain-specific filters 选出高质量真实视频作为 preferred samples $\mathbf{x}^{+}$;给定对应 prompt $\mathbf{c}$,当前生成器生成 dispreferred sample:
$$ \mathbf{x}^{-}\sim p_{\theta_{\mathrm{gen}}}(\mathbf{x}\mid\mathbf{c}). $$
Preferred 和 dispreferred 构成 preference pair $(\mathbf{c},\mathbf{x}^{+},\mathbf{x}^{-})$。生成 negatives 会周期性刷新,以反映当前 domain model 的失败模式。
Domain-specialized DPO 从 native streaming checkpoint $\theta_0$ 开始,为每个 domain 训练一个 LoRA expert:
$$ \phi_d = \theta_0+\Delta_d. $$
DPO 目标使用冻结 $\theta_0$ 作为 reference,并保留一个 preferred samples 的 reconstruction loss:
$$ \mathcal{L}{\mathrm{expert}}^{d} = \mathcal{L} \right]. $$}}^{d} + \lambda_{\mathrm{win}}\, \mathbb{E}!\left[ \ell_{\phi_d}^{+
训练后得到 frozen domain-expert bank ${\phi_d}_{d\in\mathcal{D}}$。
Reinforced On-Policy Distillation¶
直接平均 domain adapters 可能引入干扰,在推理时路由多个 experts 又增加部署复杂度。作者因此把 expert 能力整合到一个从 $\theta_0$ 初始化的 student。
对 domain $d$ 的训练样本,student 生成 $G$ 个候选 target chunks:
$$ \hat{\mathbf{x}}^{\,i}t \sim p \left( \mathbf{x}}}t \mid \mathbf{x}, \mathbf{c} \right), \qquad i=1,\dots,G. $$
Domain-specific verifier 为每个候选分配二值结果 $R_i\in{0,1}$,group success rate 为:
$$ \bar{R} = \frac{1}{G} \sum_{i=1}^{G}R_i. $$
ROPD 将候选级 outcome 与 proximal domain-expert prior 结合,transition-level reward 为:
$$ r^{\mathrm{ROPD}}{i,t,k} = \log!\left( R_i + (1-\bar{R}) \left( \alpha\,\rho + 1-\alpha \right) \right), $$
其中 $\rho_{i,t,k}$ 是 domain-expert-to-student transition ratio,$\alpha$ 控制 expert 最大贡献。直观上,如果所有候选失败,expert 提供最大额外监督;如果所有候选成功,expert 不再提供额外监督;混合情况下,失败候选获得更高 expert 权重。
作者不把 ROPD 转成 PPO-style policy-gradient,而是直接在 student-visited denoising states 上优化 pathwise objective。对 MaineCoon 的 deterministic flow model,目标在 velocity space 中实现。多 domain consolidation 时,每轮平衡访问五个 domains,使用对应 frozen LoRA 作为 teacher,并平均 domain losses:
$$ \mathcal{L}{\mathrm{round}} = \frac{1}{|\mathcal{D}|} \sum. $$}} \mathcal{L}_{\mathrm{ROPD}}^{d
同时保留 native streaming objective 作为真实数据锚:
$$ \mathcal{L}{\mathrm{post}} = \mathcal{L}. $$}} + \lambda_{\mathrm{native}}\, \mathcal{L}_{\mathrm{native}
训练结束后,所有 domain adapters 和 verifiers 被移除,推理只使用一个统一 MaineCoon policy。
Step Distillation 与训练基础设施¶
作者结合 DMD 及其变体,得到近乎无损的 four-step distilled MaineCoon base model。训练基础设施方面,22B 音视频 transformer 使用 64 张 H100,结合 FSDP2 和 Ulysses-style sequence parallelism。初始化来自 LTX-2.3 22B checkpoint;优化器为 8-bit AdamW,学习率 warmup 后保持 $1\times10^{-5}$,梯度裁剪为 1.0,并维护 decay 0.999 的 EMA 权重。总训练消耗约 1 万 GPU hours,使用约百万级高质量长视频。
Agentic Streaming Inference¶
实时社交体验不是一个完成的 clip,而是开放式交互:观众说话、打字或观看,stream 必须立即响应且不应结束。冻结的 MaineCoon generator 能以实时速度发出音视频 chunks,但它自己不能规划下一步、记住已经展示的内容,也不能在 chunk 生成中响应观众。因此,作者提出 training-free agentic streaming inference framework,位于观众和 generator 之间,把 generator 转化为分钟级交互式 stream。
框架有三个 agentic controllers:
- Agentic planner and observer:在 director 侧生成 prompt stream,逐 beat 延续故事,并把观众交互融入下一 beat。
- Agentic cache manager:在 engine 侧管理 KV-cache,在无限 stream 中保持连续性,并修正长流式生成的慢性外观漂移。
- Agentic look-ahead buffer controller:由于 generator 比 playback 更快,观众前方会积累已生成但未观看内容。该 controller 把这段 lead 变成画质和早期监控资源,同时保持交互响应。
图 5: Agentic streaming inference。
Agentic Planner and Observer¶
Prompt stream 由本地部署的 Gemma 4 26B MoE 产生。它是框架的认知核心,承担所有 reasoning;engine-side controllers 只执行固定策略。Planner 负责生成 prompt stream;observer 观察生成 stream 并向前修复 degraded content。它不启动、停止或步进 generator,generator 始终按固定 cadence 运行。
Planner 把每个 beat 写成结构化 prompt,包括场景、角色状态、动作、对话和声音线索。Feeder 把 prompt 送入 generator;fast lane 允许对用户输入的快速响应进入后续 beat。Observer 在 generation head 处观察未播放内容,若发现身份漂移、动作不连贯或音视频不对齐,会通过 forward-repair ladder 调整未来 prompts,而不是重置 stream。
Agentic Cache Manager¶
Cache manager 让每个音视频 chunk 只提交一次到 never-cleared KV-cache。为了使上下文保持在训练 regime 内,系统维护 bounded keep-set:保留 sink chunks 和最近窗口,其他内容按策略逐步 evict。Drift control 不修改已经发布的 pixels,而是在 committed copy 的内存表示上放置 drift anchors,帮助后续 generation 稳定主体身份和外观。
Agentic Look-Ahead Buffer Controller¶
MaineCoon 在单张 GPU 上约以 32 FPS 采样,而播放速度是 25 FPS,因此 generation head 会领先 playback head,形成 look-ahead buffer。这个 buffer 既是资产,也是负债:它为 planning、observation 和 forward repair 提供时间,但也提前提交了未来内容。
图 6: Look-ahead buffer。所有 agentic compute 都发生在 generation head,位于 buffer 内且领先观众。用户指令只修改尚未生成的 beats,并在下一 switch point 生效。
实验¶
作者从两个角度评估 MaineCoon:一是与代表性双向和 streaming baselines 在 SocialVideo-Bench 上比较音视频生成质量;二是在统一单 GPU H100 设置下测量生成吞吐,评估是否支持实时 streaming deployment。
设置¶
SocialVideo-Bench 包含 700 个 prompts,均匀分布在七个代表性社交视频 domains。每个样本包含两个连续 10 秒 segments,并在 segment 边界更新 conditioning prompt。
Baselines 包括三类:
- Bidirectional text-to-audio-video:JavisDiT++、Ovi、JoyAI-Echo、MoVA、LTX-2.3 base/distilled。
- Streaming text-and-audio-to-video:LiveAvatar、SoulX-FlashTalk。
- 效率比较额外包含 streaming text-to-video:Causal Forcing、Helios-Distilled、Krea。
评估指标共九个:视觉质量 Vis、运动质量 Mot、音频质量 Aud、text-video alignment IB-TV、text-audio alignment IB-TA、audio-video semantic consistency IB-AV、audio-visual temporal alignment AV-Al、Audio-Visual Harmony AVH、Joint Audio-Visual Integrated Score JAVIS。另报告九个指标 max-normalized 后平均得到的 aggregate score。
SocialVideo-Bench 主结果¶
表 2:MaineCoon 与音视频生成模型在 SocialVideo-Bench 上的主结果。
| Type | Model | Vis ↑ | Mot ↑ | Aud ↑ | IB-TV ↑ | IB-TA ↑ | IB-AV ↑ | AV-Al ↑ | AVH ↑ | JAVIS ↑ | Average ↑ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Bidirectional T2AV | JavisDiT++ | 4.39 | 2.22 | 4.06 | 0.134 | 0.070 | 0.151 | 0.312 | 0.136 | 0.112 | 0.711 |
| Bidirectional T2AV | Ovi | 4.44 | 1.89 | 3.76 | 0.138 | 0.079 | 0.191 | 0.412 | 0.188 | 0.162 | 0.779 |
| Bidirectional T2AV | JoyAI-Echo | 4.61 | 1.17 | 3.47 | 0.147 | 0.088 | 0.226 | 0.319 | 0.196 | 0.173 | 0.749 |
| Bidirectional T2AV | MoVA | 4.66 | 1.68 | 3.69 | 0.133 | 0.105 | 0.258 | 0.359 | 0.245 | 0.216 | 0.842 |
| Bidirectional T2AV | LTX-2.3 | 4.10 | 0.99 | 4.06 | 0.132 | 0.111 | 0.311 | 0.334 | 0.287 | 0.247 | 0.848 |
| Streaming TA2V | LiveAvatar | 4.60 | 1.46 | 4.13 | 0.131 | 0.120 | 0.316 | 0.326 | 0.291 | 0.246 | 0.892 |
| Streaming TA2V | SoulX-FlashTalk | 4.65 | 1.99 | 4.07 | 0.128 | 0.120 | 0.307 | 0.279 | 0.283 | 0.238 | 0.895 |
| Streaming T2AV | MaineCoon | 4.71 | 1.62 | 4.35 | 0.127 | 0.130 | 0.318 | 0.334 | 0.308 | 0.272 | 0.934 |
MaineCoon 在所有系统中获得最佳整体性能,aggregate score 为 0.934,而最强 baseline 为 0.895。它在 9 个单项指标中的 6 个排名第一,包括视觉质量、音频质量、文本-音频对齐、音频-视频语义一致性、AVH 和 JAVIS。
联合评价音频和视觉 streams 的指标提升尤其明显:AVH 从此前最好 0.291 提升到 0.308,JAVIS 从 0.247 提升到 0.272,对应相对提升 5.8% 和 10.1%。同时,MaineCoon 也取得最高视觉和音频质量分,说明 joint audio-visual consistency 的改善没有牺牲单模态 fidelity。
图 7: MaineCoon 生成案例。
Streaming Inference Efficiency¶
表 3:Latency and model size comparison。吞吐 FPS 基于单张 H100、480P、20 秒视频生成。
| Type | Model | Parameters | FPS |
|---|---|---|---|
| Bidirectional T2AV | JavisDiT++ | 1.8B | 0.87 |
| Bidirectional T2AV | Ovi | 11B | 0.58 |
| Bidirectional T2AV | JoyAI-Echo | 23B | 18.0 |
| Bidirectional T2AV | MoVA | 32B | 0.26 |
| Bidirectional T2AV | LTX-2.3 | 22B | 1.40 |
| Bidirectional T2AV | LTX-2.3-Distilled | 22B | 20.7 |
| Streaming T2V | Causal-Forcing | 1.3B | 19.1 |
| Streaming T2V | Helios-Distilled | 14B | 18.2 |
| Streaming T2V | Krea | 14B | 6.1 |
| Streaming TA2V | LiveAvatar | 14B | 6.7 |
| Streaming TA2V | SoulX-FlashTalk | 14B | 6.6 |
| Streaming T2AV | MaineCoon | 22B | 47.5 |
训练 chunk size 为 2 时,MaineCoon 已能在单张 H100 上达到 31 FPS。推理时将 chunk size 增加到 6 后,480P 视频吞吐提升到 47.5 FPS,且作者称无可观察视觉质量下降。这使其比评估中的 streaming avatar models 快约 7 倍,也快于 1.3B streaming video generation model。由于 MaineCoon 有 22B 参数且联合生成音频和视频,作者认为速度主要来自原生 causal 架构、few-step sampler、KV-cache reuse 和 agentic streaming inference,而不是小模型优势。
定位与展望:Social World Models¶
本文把 social dynamics 形式化为同步多模态行为 tokens 的高维联合概率分布。传统 world models 通常用条件 MDP 表示环境转移:
$$ P(X_{t} \mid X_{<t}, U_{<t}). $$
Social world model 则运行在连续多模态 stream 上,其中环境变化的主驱动力是人类行为。令 $V_t$ 表示视觉 tokens,包括面部表情、手势和背景 framing;$A_t$ 表示声学 tokens,包括音素、语气和环境噪声;$H_{<t}$ 表示互动用户的多模态 communicative inputs 和 human feelings 历史。作者将 social world model 形式化为:
$$ P(V_t, A_t \mid V_{<t}, A_{<t}, H_{<t}). $$
这个范式与传统 world modeling 的关键区别在于:物理 world models 学习球如何弹跳、水面如何反光、文字如何出现在标志上;social world model 则把 human agent 作为生成空间的主要坐标系,优化高保真人类表情、快速语义转移和情感共鸣。
作者认为下一步是 Real-Time Dual-System Full-Duplex Interaction。传统交互式 avatar 和对话模型通常是 half-duplex:用户说,系统处理,系统回答,用户被动听。这种轮流约束破坏了社交真实感,因为人类不会在等待 API 响应时冻结表情或认知状态。
完整 social world model 需要处理 continuous、interlaced、多模态输入输出,并使用双系统处理:
- System 1:Fast Cerebellum。 低开销 reactive model,维持亚秒级响应循环,负责即时同步、streaming denoising、快速 viseme matching、点头或肯定声等即时反馈。
- System 2:Planning Brain。 更大的战略性 deliberative network,异步运行,负责长程轨迹规划、深层语义理解、长期 persona preference cache management 和结构化对话引导。
结论¶
本文提出 social world models 的定位,指出生成式 AI 中一个被忽视的缺口:以人为中心的交互式音视频模拟。Social world model 需要主动观察用户、内部模拟社交动态,并实时响应人类。
作为迈向该范式的第一步,本文提出 MaineCoon,一个 22B 参数实时音视频自回归生成模型。作者称,它不仅为社交互动应用设计和优化,也是第一个可在单张 GPU 上实时生成并交互的音视频生成模型。
通过引入 self-resampling、跨模态表征对齐、data-domain-aware preference optimization 和 ROPD 的多阶段 forcing-free streaming training,MaineCoon 突破了实时多模态生成的计算和延迟障碍。它实现亚秒级交互,单 GPU 最高 47.5 FPS,生成成本低于每秒 0.001 美元。作者还设计了 agentic streaming inference framework,用 agentic cache management 和 prompt planning 支持千秒级长程视频生成。SocialVideo Bench 则为该领域提供了包含 9 个社交互动指标的评估框架。
作者最后强调,social world model 范式将生成式 AI 从被动内容生成工具转向人类社交动态中的主动响应参与者。未来工作将构建 active observation module 和 internal social simulator module,并联合优化三个核心模块,包括 reactive module MaineCoon。
更多定性案例¶
附录展示了 MaineCoon 在 SocialVideo-Bench 七个 domains 上的更多定性案例,包括 dense speech、two-person interaction、music and vocal、emotional performance、dance 和 social memes。作者报告的观察包括:dense speech 中唇形同步和语音清晰度保持较好;music/vocal 中音色和节奏动作较一致;two-person interaction 中说话者身份和 turn-taking 保持较自然;dance/high-motion 中大幅身体动作保持时间连贯;emotional performance 中表情与语调变化过渡平滑;social memes 中能捕捉幽默时机、叙事反转和反应式表达。