Video Generation
Jul 26, 2026

Resumo do dia
A Black Forest Labs lançou o modelo FLUX 3, que pode gerar vídeos com áudio nativamente, marcando um avanço significativo na geração de conteúdo audiovisual por inteligência artificial. Enquanto isso, um estudo alertou que vídeos gerados por IA estão abalando a confiança das pessoas em vídeos reais, mesmo quando claramente identificados como sintéticos. No mercado, a Midjourney adquiriu o aplicativo Co-Star, expandindo seu portfólio além da geração de imagens.
Principais notícias
- 1
Plataforma de processamento de vídeo egocêntrico é lançada e busca parceiros acadêmicos
O que aconteceu: Uma startup desenvolveu uma plataforma que automatiza o pipeline de preparação de dados (ETL) para vídeo egocêntrico e espacial, convertendo gravações brutas em saídas prontas para modelos, voltadas para robótica e desenvolvimento de modelos de visão-linguagem-ação (VLA). A equipe está recrutando abertamente laboratórios de pesquisa e empresas para testar o serviço gratuitamente. Por que é importante: As equipes que desenvolvem IA física e sistemas de teleoperação atualmente gastam tempo significativo de GPU e esforço de engenharia no pré-processamento de dados de vídeo — um gargalo que a plataforma foi projetada para eliminar. Ao lidar com a infraestrutura de dados a montante, ela libera recursos computacionais e ciclos de engenharia para o trabalho central do modelo.
O que acompanhar: A oferta é limitada a laboratórios dispostos a fornecer feedback; equipes interessadas são convidadas a comentar ou enviar mensagens diretas para discutir participação. Nenhum preço, data de disponibilidade ou cronograma formal de lançamento foi divulgado.
- 2
Midjourney adquire aplicativo de astrologia Co-Star
O que aconteceu: Midjourney, um laboratório de IA conhecido por seus geradores de imagens e vídeos, adquiriu o aplicativo de astrologia social Co-Star. Os termos do acordo não foram divulgados. A equipe de cerca de duas dezenas de funcionários da Co-Star se juntou à Midjourney. Por que importa: Co-Star tem aproximadamente 4,3 milhões de usuários ativos mensais e utiliza IA e redação humana para gerar horóscopos e avaliações de compatibilidade astrológica. A aquisição sinaliza a expansão da Midjourney além de seu negócio principal de geração de imagens para aplicativos voltados ao consumidor, seguindo seus esforços para construir divisões de medicina e spa.
O que acompanhar: Midjourney atualmente opera principalmente através do Discord sem aplicativo independente. A experiência da equipe da Co-Star em construir aplicativos para consumidores sugere que Midjourney pode finalmente desenvolver seu próprio aplicativo independente.
- 3
Black Forest Labs lança modelo multimodal FLUX 3 abrangendo vídeo, áudio e robótica
O que aconteceu: Black Forest Labs anunciou o FLUX 3, um modelo multimodal unificado treinado em uma única arquitetura que manipula geração de imagem, vídeo, áudio e previsão de ações. A empresa também apresentou o FLUX-mimic, um modelo de robótica vídeo-ação construído sobre o FLUX 3 e testado com a Audi para implantação em fábrica real em uma única GPU local. Por que importa: FLUX 3 reproduz e estende capacidades anteriormente demonstradas separadamente por outros laboratórios de ponta (Gemini Omni, Grok Imagine, Seedance 2.0), com a equipe se comprometendo a abrir uma versão para desenvolvedores com pesos abertos. A aplicação robótica sinaliza que a modelagem de mundo de vídeo pode se transferir diretamente para controle de robôs, potencialmente reduzindo barreiras para laboratórios que constroem modelos abertos competitivos sem dependência de ecossistemas fechados.
O que observar: FLUX 3 Video está atualmente em acesso antecipado. A capacidade do modelo de unificar controle de imagem, vídeo, áudio e robótica em uma única arquitetura—treinada conjuntamente em vez de como módulos separados—moldará se sistemas multimodais se tornam padrão da indústria ou permanecem fragmentados por tarefa.
- 4
Vídeos com IA Abalaram a Confiança em Vídeos Reais Mesmo quando Identificados, Aponta Estudo
O que aconteceu: Pesquisadores realizaram um estudo em duas fases com 100 participantes comparando aqueles expostos a vídeos gerados por IA com um grupo de controle que assistiu a vídeos gerados por humanos. O grupo exposto a IA depois assistiu a conteúdo gerado por humanos junto com o grupo de controle e relatou dúvidas aumentadas sobre a autenticidade de vídeos subsequentes, redução na confiança em seu julgamento, maior disrupção perceptual e menor conexão social—apesar da divulgação clara de que o conteúdo sintético era gerado por IA. Por que importa: Os achados revelam que simplesmente identificar vídeos gerados por IA não impede que minarem a confiança dos espectadores em vídeos reais. Isso sugere que os efeitos psicológicos e perceptuais de ver conteúdo sintético realista se estendem a gravações genuínas, mesmo quando os espectadores conhecem a fonte. Para plataformas e criadores de conteúdo, isso indica a necessidade de estratégias além de detecção e divulgação para proteger como as pessoas experimentam e confiam na mídia visual.
O que acompanhar: A pesquisa destaca que abordagens de design e política devem lidar com os impactos experienciais e psicológicos da exposição a vídeos gerados por IA, não apenas focar em distinguir falso de real. O estudo foi apresentado na Conferência CHI 2026 sobre Fatores Humanos em Sistemas de Computação.
- 5
Black Forest Labs lança Flux 3 com geração nativa de vídeo com áudio
O que aconteceu: A empresa alemã de IA Black Forest Labs lançou o Flux 3, um modelo de fundação multimodal que aprende a partir de imagens, vídeos e áudio em conjunto. O modelo consegue gerar vídeos com áudio nativo de até vinte segundos pela primeira vez, suportando texto para vídeo, imagem para vídeo, vídeo para vídeo, transições baseadas em keyframes, diálogo multilíngue e links orientados por agentes entre clipes. Por que importa: Em avaliações iniciais usando clipes de dez segundos em 720p, o Flux 3 foi preferido em relação a múltiplos rivais: noventa e três por cento sobre Luma Ray 3.2, setenta e sete por cento sobre Runway Gen-4.5 e sessenta e nove por cento sobre Grok Imagine Video. Contra concorrentes mais fortes, igualou-se ou aproximou-se bastante de Seedance 2.0 e Gemini Omni Flash (cada um com cinquenta e dois por cento de preferência), que já servem fluxos de produção em larga escala. A BFL também desenvolveu o Flux-mimic, um modelo de ação de vídeo sendo testado em tarefas de produção na Audi, sugerindo que a arquitetura se estende a aplicações robóticas.
O que acompanhar: O Flux 3 Image será lançado em acesso antecipado nas próximas semanas, com melhorias em prompts complexos e renderização de texto multilíngue. A predição de ações será oferecida inicialmente através de parceiros selecionados. A BFL planeja oferecer acesso com pesos abertos ao backbone multimodal sob o nome 'Flux 3 Dev', com trabalho de longo prazo em um modelo único que combine previsão de percepção, ação e linguagem.
- 6
Criador realiza filme de longa-metragem usando LLM e o classifica como fracasso
O que aconteceu: Um criador de conteúdo utilizou um LLM (Claude Fable 5) para produzir uma adaptação cinematográfica em longa-metragem de The House on the Borderland, de William Hope Hodgson, que foi enviado para seu canal no YouTube junto com videoclipes e álbuns gerados por IA. Por que é importante: O experimento testa se grandes modelos de linguagem conseguem manter a produção criativa ao longo de um projeto de comprimento integral sem intervenção humana—uma questão que tem implicações sobre que tipos de trabalho criativo continuam além das capacidades atuais de IA, mesmo quando lhes é permitido operar de forma independente e com tempo suficiente.
Fique atento: O criador caracteriza o resultado como um fracasso apesar de lançá-lo, observando que o avaliou apenas pelos padrões do canal YouTube em vez do cinema como categoria integral; ele atribui a limitação não à agência ou ao planejamento do LLM, mas a outros fatores que discute na matéria completa.
Em breve
Fique atento ao lançamento do Flux 3 Image nas próximas semanas e à evolução de modelos multimodais unificados que promovem controlar imagem, vídeo, áudio e robótica em uma única arquitetura—enquanto isso, acompanhe como Midjourney pode desenvolver seu próprio aplicativo independente e como a indústria aborda os impactos psicológicos dos vídeos gerados por IA, não apenas sua autenticidade.
Fontes
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free