Video Generation
Jul 26, 2026

今日要点
视频生成领域今日多项进展,Black Forest Labs推出了FLUX 3多模态模型,支持视频、音频和机器人技术的生成,而自主视角视频处理平台也已上线。不过研究显示AI生成视频正在动摇观众对真实视频的信任,即使明确标注AI生成内容也难以改善这一问题,同时创作者用大语言模型制作长篇电影的尝试也被认为是失败的。
主要新闻
- 1
自主视角视频处理平台上线,寻求实验室合作伙伴
发生了什么:一家初创公司推出了一个平台,可自动化处理自主视角和空间视频的数据准备(ETL)流程,将原始视频转换为可供机器人和视觉语言动作(VLA)模型开发使用的即用型输出。该团队正在公开招募研究实验室和公司免费测试该服务。 为什么重要:从事物理人工智能和遥操作系统开发的团队目前在视频数据预处理上需要投入大量GPU时间和工程力量——这正是该平台旨在消除的瓶颈。通过在上游处理数据管道工作,它可以释放计算资源和工程周期,让团队专注于核心模型开发。
值得关注:该服务仅限愿意提供反馈的实验室使用;感兴趣的团队可在评论中或直接私信讨论参与事宜。目前未公布定价、上线日期或正式发布时间表。
- 2
Midjourney 收购占星应用 Co-Star
发生了什么:以图像和视频生成器著称的人工智能实验室 Midjourney 已收购社交占星应用 Co-Star。交易条款未公开。Co-Star 约二十名员工已加入 Midjourney。 为什么重要:Co-Star 拥有约 430 万月活跃用户,利用人工智能和人工撰写生成星座运势和占星兼容性评估。此次收购表明 Midjourney 正在扩展业务范围,从核心图像生成业务拓展到消费者应用,此前该公司已努力建立医疗和水疗部门。
值得关注:Midjourney 目前主要通过 Discord 运营,没有独立应用。Co-Star 团队在构建消费者应用方面的经验表明 Midjourney 可能最终会开发自己的独立应用。
- 3
Black Forest Labs推出FLUX 3多模态模型,涵盖视频、音频和机器人技术
发生了什么:Black Forest Labs宣布推出FLUX 3,这是一个在单一架构中训练的统一多模态模型,可处理图像、视频、音频生成和动作预测。该公司还推出了FLUX-mimic,这是一个基于FLUX 3的视频动作机器人模型,已与奥迪合作测试,用于在单个本地GPU上进行真实工厂部署。 为什么重要:FLUX 3复现并扩展了其他前沿实验室(Gemini Omni、Grok Imagine、Seedance 2.0)之前分别展示的能力,该团队承诺推出开放权重的开发者版本。机器人应用表明视频世界建模可以直接转移到机器人控制,这可能会降低实验室在不依赖封闭生态系统的情况下构建具有竞争力的开源模型的门槛。
值得关注:FLUX 3 Video目前处于早期测试阶段。该模型在单一架构中统一图像、视频、音频和机器人控制的能力——通过联合训练而非作为单独模块——将决定多模态系统是否成为行业标准,还是继续按任务分割。
- 4
AI视频动摇观众对真实视频的信任 即使明确标注也无法改善 研究发现
发生了什么:研究人员进行了一项分两个阶段的研究,共有100名参与者,对比了接触AI生成视频的人群与观看人类生成视频的对照组。接触AI视频的小组随后与对照组一起观看人类生成的内容,结果显示他们对随后视频真实性的怀疑增加、对自身判断力的信心下降、感知干扰加剧、社交联系感降低——尽管研究明确披露了这些合成内容由AI生成。 为什么重要:研究结果表明,仅仅标注AI生成视频并不能防止它们破坏观众对真实视频的信任。这表明接触逼真合成内容所产生的心理和感知效应会延伸到真实影像,即使观众知道其来源。对于平台和内容创作者而言,这表明需要采取超越检测和披露的策略来保护人们对视觉媒体的体验和信任。
值得关注:研究强调,设计和政策方法必须解决AI生成视频曝露的体验和心理影响,而不仅仅关注如何区分虚假和真实内容。该研究在2026年CHI人机交互系统会议上发表。
- 5
Black Forest Labs、音声付き動画生成に対応したFlux 3発表
Black Forest Labsは、画像・動画・音声から学習する多模型基盤モデル「Flux 3」をリリースしました。同社のテストでは市場リーダーのSeedance 2.0をわずかに上回る性能を示しており、最大20秒の音声付き動画生成に初めて対応しています。 従来、動画生成AIは音声なしが一般的でしたが、Flux 3は生成時にネイティブで音声を付与できるため、配信やコンテンツ制作の効率化につながる可能性があります。Black Forest Labsはこの技術をロボティクスタスクでも試験中で、実世界応用への展開も進んでいるとみられます。
独立した第三者による評価結果はまだ公開されていません。同社は最終的には汎用的な世界モデル(物理世界を模倣するAI)の構築を目指しており、その進展が注視されます。
- 6
创作者用大语言模型制作长篇电影,称其为失败
发生了什么:一位内容创作者使用大语言模型(Claude Fable 5)创作了威廉·霍普·霍奇森的《边界之屋》的长篇电影改编版,并将其上传到YouTube频道,同时还发布了音乐视频和AI生成的专辑。 为什么重要:这项实验测试了大语言模型是否能够在完整项目中维持创意输出,而无需人类干预——这个问题关乎哪些创意工作仍然超越当前AI能力范围,即便给予足够的时间和独立运作的自由。
值得关注:尽管发布了作品,创作者仍将结果定性为失败,指出他们仅以YouTube频道的标准来评判,而非将其视为完整的电影作品;他们认为不足之处并非源于大语言模型的自主性或规划能力,而是他们在完整文章中讨论的其他因素。
接下来关注
随着 FLUX 3 Video 等多模态模型进入早期测试阶段,以及 Midjourney 等服务逐步从 Discord 平台向独立应用演进,视频生成技术的商用化进程值得密切关注——特别是这些工具如何在定价、发布时间表和实际应用效果方面取得进展。同时,关于 AI 生成视频对用户心理和体验的影响,以及多模态系统是否能成为行业标准等关键问题,将在未来的研究和产业实践中逐步得到解答。
来源
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free