Video Generation
Jul 29, 2026

今日要点
视频生成领域迎来重大进展:Black Forest Labs推出FLUX 3多模态模型,支持视频、音频和机器人应用,而mimic robotics通过FLUX-mimic技术将机器人训练时间大幅压缩至30分钟;与此同时,Runway、自我中心视频处理平台等也在推动该领域创新,但研究发现AI生成视频即使带有标签仍可能动摇公众对真实视频的信任度。
主要新闻
- 1
mimic robotics在奥迪部署FLUX-mimic,将机器人训练时间从30小时缩短至30分钟
发生了什么:mimic robotics推出了FLUX-mimic,这是一款由Black Forest Labs的FLUX 3视频模型构建的视频动作模型,使机器人能够从仅30分钟的机器人数据中学习复杂的操控任务,而不是需要30小时或更长时间。该公司已经与奥迪部署该系统,用于汽车生产中的灵活精细操作自动化。 为何重要:涉及柔性零件和精细操作的制造任务尽管经历了数十年的机器人投资仍然需要手工完成,因为常规编程的机器人单元对于生产变体的重新设计成本过高。FLUX-mimic能够从对物理动力学的视频理解而非静态图像中学习,这使奥迪等工厂能够自动化以前无法处理的任务,而无需花费数月的工程努力,符合奥迪对智能工厂的愿景,在智能工厂中机器人与员工在重复性和体力劳动中进行协作。
需要关注:奥迪的生产环境已在进行软体操作工作的FLUX-mimic测试和部署,奥迪表示这些工作在使用常规机器人的情况下本不可能实现。该合作旨在证明该系统能够在实际生产线上可靠地处理非结构化任务,而无需大量的集成开销。
- 2
Runway把AI视频bug改成功能 实时头像漂移成特性
Runway在开发实时AI视频模型Runway Characters时遇到一个持久性bug——AI生成的头像在视频生成过程中会偏离中心。团队花了数周试图通过后端修复解决,最终选择了前端功能方案来绕过这个问题。 Runway ML企业产品主管Ryan Phillips在VB Transform 2026大会上分享这个案例,表明即使不是直接构建基础模型的公司,也可以从Runway构建、评估和发布模型的方式中学到经验。这种实用的工程决策对日常产品开发有参考价值。
Runway Characters支持与AI生成头像进行零延迟、双向实时交互——这在五年前是无法实现的。
- 3
自我中心视频处理平台上线,寻求实验室合作伙伴
发生了什么:一家初创公司打造了一个平台,可以自动化处理自我中心视频和空间视频的数据准备(ETL)流程,将原始素材转换为机器人和视觉语言动作(VLA)模型开发所需的模型就绪输出。该团队正在公开招募研究实验室和企业免费测试该服务。 为何重要:构建物理人工智能和遥操作系统的团队目前需要花费大量GPU时间和工程力量进行视频数据预处理——这个平台旨在消除这一瓶颈。通过在上游处理数据管道,它可以释放计算资源和工程周期,让团队专注于核心模型工作。
值得关注:该优惠仅限愿意提供反馈的实验室;感兴趣的团队可以直接评论或发送消息讨论参与事宜。目前未公布定价、推出日期或正式上线时间表。
- 4
Midjourney收购占星应用Co-Star
发生了什么:以图像和视频生成器著称的AI实验室Midjourney已收购社交占星应用Co-Star。交易条款未披露。Co-Star约二十多名员工已加入Midjourney。 为什么重要:Co-Star拥有约430万月活用户,利用AI和人工撰写生成星座运势和占星学相容性评估。此次收购标志着Midjourney在扩展其核心图像生成业务之外进入消费者应用领域,继其建立医疗和水疗部门的努力之后。
值得关注:Midjourney目前主要通过Discord运营,没有独立应用。Co-Star团队在构建消费者应用方面的经验表明Midjourney可能最终会开发自己的独立应用程序。
- 5
Black Forest Labs推出FLUX 3多模态模型,涵盖视频、音频和机器人应用
发生了什么:Black Forest Labs宣布推出FLUX 3,这是一个在单一架构中训练的统一多模态模型,可处理图像、视频、音频生成以及动作预测。该公司还推出了FLUX-mimic,这是一个基于FLUX 3构建的视频动作机器人模型,已与奥迪合作测试,可在单个本地GPU上进行真实工厂部署。 为什么重要:FLUX 3再现并扩展了Gemini Omni、Grok Imagine、Seedance 2.0等其他前沿实验室之前单独展示的能力,该团队承诺推出开放权重的开发者版本。机器人应用表明视频世界建模可以直接转移到机器人控制,这可能会降低实验室构建具有竞争力的开放模型的门槛,而不依赖于封闭生态系统。
值得关注的是:FLUX 3 Video目前处于早期访问阶段。该模型在单一架构中统一图像、视频、音频和机器人控制的能力——通过联合训练而非作为独立模块——将决定多模态系统是否成为行业标准,还是仍然因任务而分散。
- 6
AI生成视频动摇真实视频信任度,即使带有标签也难以避免,研究发现
发生了什么:研究人员进行了两阶段研究,共100名参与者参与,比较了接触AI生成视频的人群与观看人类生成视频的对照组。接触AI视频的小组随后与对照组一起观看人类生成的内容,并报告对随后视频真实性的疑虑增加、对自身判断的信心下降、感知混乱加剧以及社交连接感降低——尽管有明确标注这些内容是AI生成的。 为什么重要:研究结果表明,仅仅标注AI生成视频并不能阻止它们削弱观众对真实视频的信任。这表明看到逼真合成内容的心理和感知影响会延伸到真实素材,即使观众知道其来源。对于平台和内容创作者来说,这意味着需要超越检测和披露的策略来保护人们对视觉媒体的体验和信任。
值得关注:该研究强调,设计和政策方法必须解决AI生成视频接触的体验和心理影响,而不仅仅关注区分虚假内容和真实内容。该研究在2026年CHI人机交互计算系统会议上发表。
接下来关注
值得关注的是FLUX-mimic在奥迪生产线上的实际应用进展,以及FLUX 3 Video能否通过统一的多模态架构成为行业标准——这将直接影响AI视频生成技术从实验室走向大规模工业应用的速度。同时,随着Runway Characters实现零延迟实时交互和Midjourney可能推出独立应用,消费者与AI生成内容的交互方式正在发生根本性转变,而相关的心理影响和设计规范的建立将成为决定这些技术能否健康发展的关键因素。
来源
- mimic robotics introduces ‘frontier video-action models’ to the factory floor at Audi
- Runway couldn't fix a bug in its AI video model, so it turned the bug into a feature
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free