AIToday您的AI新闻摘要

Video Generation

Jul 24, 2026

Video Generation

今日要点

视频生成领域今天发布了多项重要进展:Black Forest Labs推出了Flux 3多模态模型,支持原生视频、音频和机器人内容生成;同时一个自主视角视频处理平台正式推出并寻求实验室合作;不过研究表明即便AI生成的视频被标注,仍会削弱人们对真实视频的信任。

主要新闻

  1. 1

    自主视角视频处理平台正式推出,寻求实验室合作伙伴

    发生了什么:一家初创公司开发了一个平台,可自动化处理自主视角和空间视频的数据准备(ETL)流程,将原始视频转换为可直接用于机器人和视觉语言动作(VLA)模型开发的数据。该团队正公开招募研究实验室和公司免费测试该服务。 为什么重要:从事物理人工智能和遥操作系统开发的团队目前需要花费大量GPU时间和工程力量进行视频数据预处理——这个平台旨在消除这一瓶颈。通过在上游处理数据管道工作,它可以释放计算资源和工程周期,让团队专注于核心模型开发。

    值得关注的是:这项服务仅限于愿意提供反馈的实验室;感兴趣的团队可以直接留言或联系讨论参与事宜。目前尚未公布定价、上线日期或正式发布时间表。

  2. 2

    Midjourney收购占星应用Co-Star

    发生了什么:以图像和视频生成器著称的AI实验室Midjourney收购了社交占星应用Co-Star。交易条款未披露。Co-Star的约二十名员工已加入Midjourney。 为什么重要:Co-Star拥有约430万月活跃用户,利用AI和人工写作生成星座运势和占星相容性评估。此次收购表明Midjourney正在扩展业务范围,从核心图像生成业务拓展至消费者应用,之前还曾努力建立医疗和水疗部门。

    值得关注:Midjourney目前主要通过Discord运营,没有独立应用。Co-Star团队在构建消费者应用方面的经验表明,Midjourney可能最终会开发自己的独立应用。

  3. 3

    Black Forest Labs推出FLUX 3多模态模型,覆盖视频、音频、机器人领域

    发生了什么:Black Forest Labs宣布推出FLUX 3,这是一个在单一架构中训练的统一多模态模型,能够处理图像、视频、音频生成以及动作预测。该公司还推出了FLUX-mimic,这是一个基于FLUX 3的视频动作机器人模型,已与奥迪合作进行实际工厂部署测试,仅需单个本地GPU即可运行。 为什么重要:FLUX 3再现并扩展了其他前沿实验室(Gemini Omni、Grok Imagine、Seedance 2.0)分别展示的功能,该团队承诺推出开放权重的开发者版本。机器人应用表明视频世界建模可以直接转移到机器人控制,有可能降低实验室构建具有竞争力的开放模型的门槛,无需依赖封闭生态系统。

    关注重点:FLUX 3 Video目前处于早期访问阶段。该模型在单一架构中统一图像、视频、音频和机器人控制的能力——通过联合训练而非作为独立模块——将决定多模态系统是成为行业标准,还是继续按任务分化。

  4. 4

    AI视频即使被标注仍会动摇人们对真实视频的信任,研究发现

    发生了什么:研究人员进行了一项分为两个阶段的研究,共有100名参与者,对比了接触AI生成视频的人群与观看人类生成视频的对照组。接触AI视频的组随后与对照组一起观看人类生成内容,并报告称对后续视频真实性产生了更多怀疑、对自己判断力的信心下降、感知能力出现更大混乱,以及社交连接感降低——尽管明确披露了合成内容是由AI生成的。 为什么这很重要:研究结果表明,仅仅标注AI生成视频并不能防止它们破坏观众对真实视频的信任。这表明看到逼真合成内容所产生的心理和感知影响会延续到真实视频上,即使观众知道其来源。对于平台和内容创作者而言,这意味着除了检测和披露之外,还需要采取超越这些策略的方法来保护人们对视觉媒体的体验和信任。

    值得关注的是:这项研究强调,设计和政策方案必须解决接触AI生成视频所带来的体验和心理影响,而不仅仅是关注区分虚假和真实内容。该研究在2026年CHI人机交互因素会议上发表。

  5. 5

    Black Forest Labs发布Flux 3,支持原生音视频生成

    发生了什么:德国AI公司Black Forest Labs发布了Flux 3,这是一个多模态基础模型,可以同时从图像、视频和音频中学习。该模型首次能够生成最长20秒的原生音频视频,支持文本生成视频、图像生成视频、视频生成视频、关键帧转场、多语言对话和剪辑间的代理驱动链接。 为什么重要:在使用10秒剪辑720p分辨率进行的早期评估中,Flux 3相比多个竞争对手更受欢迎:相比Luma Ray 3.2超过93%,相比Runway Gen-4.5超过77%,相比Grok Imagine Video超过69%。面对实力更强的竞争对手时,它与Seedance 2.0和Gemini Omni Flash打成平手或接近(各占52%偏好度),后两者已经服务于主要制作工作流。BFL还开发了Flux-mimic视频动作模型,正在奥迪的制作任务中测试,表明该架构可扩展到机器人应用。

    值得关注:Flux 3 Image将在未来几周内启动早期访问,改进复杂提示和多语言文本渲染。动作预测初期仅通过精选合作伙伴提供。BFL计划以"Flux 3 Dev"的名义提供多模态骨干网络的开放权重访问,长期计划开发单一模型来结合感知、动作和语言预测。

  6. 6

    创作者用大型语言模型制作长篇电影,称其为失败

    发生了什么:一位内容创作者使用大型语言模型(Claude Fable 5)制作了威廉·霍普·霍奇森著作《边境之屋》的长篇电影改编版,并将其与音乐视频和人工智能生成的专辑一起上传到他们的YouTube频道。 为什么重要:该实验测试了大型语言模型在没有人类干预的情况下是否能够在完整项目的全过程中维持创意产出——这个问题关乎即使在获得充分时间和独立运作许可的情况下,当前人工智能能力仍无法涉及的创意工作类型。

    值得关注的是:创作者尽管发布了这部作品,但将其定性为失败,指出他们仅按YouTube频道标准而非整个电影类别来评判该作品;他们将不足之处归咎于非语言模型的决策或规划能力,而是归咎于他们在完整文章中讨论的其他因素。

接下来关注

接下来值得关注的是,Midjourney、FLUX 3等AI视频生成工具正处于快速迭代阶段,从Discord独占运营到独立应用、从单一任务到多模态统一能力的发展路线,将在未来几周和几个月内逐步明确。同时,随着AI生成视频技术的进步,如何在设计和政策层面应对其对用户体验和心理健康的影响,以及创作者在实践中如何理性评估这些工具的能力边界,将成为行业和社会需要共同思考的核心问题。

来源

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free