跳转至

Social World Models

面向实时音视频生成、社交互动、流式多模态世界模型的论文整理。

已读论文

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

定位。 MaineCoon 把社交视频生成提升为 social world model 的生成核心问题:模型应能实时生成同步音频和视频,并作为低延迟社交互动系统的一部分持续响应用户。

方法。 论文构建 22B causal streaming audio-visual generator,训练上使用 self-resampling 缓解 generated-history 分布差距,用 V-JEPA 2 表征对齐加速语义结构学习,用 domain DPO experts 和 ROPD 做多 domain post-training。推理上设计 training-free agentic streaming inference,包括 planner/observer、cache manager 和 look-ahead buffer controller。

实验。 SocialVideo Bench 覆盖七类社交视频场景和九个评估指标。MaineCoon aggregate score 为 0.934,优于最强 baseline 0.895;单张 H100 上 480P 生成最高 47.5 FPS。

注意。 论文属于系统型 technical report,关键指标依赖自建 benchmark 和项目侧实现。后续需要关注独立复现、数据来源、肖像/声音安全、深度伪造治理和社交沉浸式风险。