AIToday您的AI新闻摘要

Video Generation

Jul 25, 2026

Video Generation

今日要点

视频生成领域今日要闻包括:Black Forest Labs推出FLUX 3多模态模型,首次实现视频原生音频生成,覆盖视频、音频和机器人应用;Midjourney收购占星应用Co-Star扩展业务范围;同时研究表明即使被标注,AI生成视频仍会削弱人们对真实视频的信任度。

主要新闻

  1. 1

    自我中心视角视频处理平台推出,寻求实验室合作伙伴

    发生了什么:一家初创公司打造了一个平台,可以自动化处理自我中心视角和空间视频的数据准备(ETL)流程,将原始视频转换为可直接用于机器人和视觉语言动作(VLA)模型开发的输出。该团队正在公开招募研究实验室和企业免费测试该服务。 为什么重要:建设物理人工智能和远程操作系统的团队目前在视频数据预处理上花费大量GPU时间和工程力量——而该平台正是为消除这一瓶颈而设计。通过在上游处理数据管道,它可以释放计算资源和工程周期用于核心模型开发。

    值得关注:该优惠仅限于愿意提供反馈的实验室;有意参与的团队可以评论或直接发消息讨论合作事宜。目前未公布定价、可用时间或正式推出时间表。

  2. 2

    Midjourney收购占星应用Co-Star

    发生了什么:以图像和视频生成器闻名的AI实验室Midjourney已收购社交占星应用Co-Star。交易条款未披露。Co-Star的约二十名员工已加入Midjourney。 为何重要:Co-Star拥有约430万月活跃用户,利用AI和人工撰写生成星座运势和占星兼容性评估。此次收购表明Midjourney正在向消费者应用扩展,超越其核心图像生成业务,继续其开发医疗和水疗部门的努力。

    值得关注:Midjourney目前主要通过Discord运营,没有独立应用。Co-Star团队在开发消费者应用方面的经验表明Midjourney可能最终会开发自己的独立应用。

  3. 3

    Black Forest Labs推出涵盖视频、音频和机器人的FLUX 3多模态模型

    发生了什么:Black Forest Labs宣布推出FLUX 3,这是一个在统一架构中训练的多模态模型,可处理图像、视频、音频生成和动作预测。该公司还推出了FLUX-mimic,一个基于FLUX 3的视频动作机器人模型,已与奥迪合作测试,用于在单个本地GPU上进行真实工厂部署。 为什么重要:FLUX 3复制并扩展了其他前沿实验室(Gemini Omni、Grok Imagine、Seedance 2.0)之前分别展示的能力,该团队承诺推出开放权重的开发者版本。机器人应用表明视频世界建模可以直接转移到机器人控制,可能降低实验室构建有竞争力的开放模型的门槛,无需依赖封闭生态系统。

    需要关注:FLUX 3 Video目前处于早期访问阶段。该模型在单一架构中统一图像、视频、音频和机器人控制的能力——通过联合训练而非作为独立模块——将决定多模态系统是成为行业标准还是继续按任务分割。

  4. 4

    研究发现:AI视频即使被标注仍会动摇人们对真实视频的信任

    发生了什么:研究人员进行了一项两阶段研究,共有100名参与者,其中一组观看AI生成的视频,对照组观看人类生成的视频。接后,AI曝露组与对照组一起观看人类生成的内容,结果表明他们对后续视频的真实性产生了更多疑虑、对自身判断力信心下降、感知干扰加剧,以及社会联系感降低——尽管合成内容被明确标注为AI生成。 为什么重要:研究结果表明,仅仅标注AI生成的视频并不能阻止其削弱观众对真实视频的信任。这说明观看逼真合成内容的心理和感知效应会延伸到真实素材,即使观众知道其来源。对于平台和内容创作者而言,这表明需要采取超越检测和披露的策略来保护人们对视觉媒体的体验和信任。

    值得关注:该研究强调设计和政策方案必须解决AI生成视频曝露的体验和心理影响,而不仅仅关注区分真假。该研究在2026年CHI人机交互系统会议上发表。

  5. 5

    Black Forest Labs推出Flux 3,首次实现视频原生音频生成

    Black Forest Labs发布了多模态基础模型Flux 3,可以学习图像、视频和音频,并首次实现生成带原生音频的视频,时长可达20秒。 这是视频生成领域的技术突破。Black Forest Labs的内部测试显示Flux 3性能超越市场领头羊Seedance 2.0,尽管独立评估结果尚未公布。

    Black Forest Labs计划以此为基础构建世界模型,目前正在机器人任务上测试Flux 3的能力。

  6. 6

    创意工作者使用LLM制作长篇电影,称其为失败

    发生了什么:一位内容创意者使用LLM(Claude Fable 5)制作了William Hope Hodgson著作《边界之家》的长篇电影改编版本,并将其上传到他们的YouTube频道,同时还发布了音乐视频和AI生成的专辑。 为什么重要:该实验测试了大型语言模型是否能够在人工干预的情况下独立完成整部项目的创意输出——这个问题涉及哪些类型的创意工作仍然超出当前AI能力范围,即使给予充足时间和自主操作的许可。

    值得关注:尽管发布了作品,这位创意者仍将结果定性为失败,指出他们仅按YouTube频道标准而非整体电影类别进行评判;他们将不足之处归因于非LLM的自主性或规划能力,而是归因于他们在完整文章中讨论的其他因素。

接下来关注

随着 FLUX 3 Video 进入早期访问阶段,业界应密切关注其统一多模态能力(图像、视频、音频和机器人控制)能否成为行业标准,以及 Midjourney 是否会推出独立应用来挑战现有格局。同时,关于 AI 生成视频的心理影响研究也在升温,这将推动设计和政策需要从单纯辨别真伪升级到全面应对用户体验问题。

来源

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free