Video Generation
Jul 27, 2026

Resumo do dia
A Black Forest Labs lançou o modelo FLUX 3, capaz de gerar vídeo e áudio nativamente, representando um avanço significativo na criação de conteúdo multimídia por inteligência artificial. Enquanto isso, um novo estudo revela que vídeos gerados por IA estão abalando a confiança das pessoas em vídeos reais, mesmo quando claramente rotulados, levantando preocupações sobre a credibilidade do conteúdo visual. A indústria também continua evoluindo com plataformas especializadas em processamento de vídeo egocêntrico buscando parcerias, enquanto criadores exploram os limites dessas tecnologias em projetos como longas-metragens.
Principais notícias
- 1
Plataforma de processamento para vídeo egocêntrico é lançada e busca parceiros em laboratórios
O que aconteceu: Uma startup desenvolveu uma plataforma que automatiza o pipeline de preparação de dados (ETL) para vídeo egocêntrico e espacial, convertendo footage bruto em saídas prontas para modelos no desenvolvimento de robótica e modelos de visão-linguagem-ação (VLA). O time está recrutando abertamente laboratórios de pesquisa e empresas para testar o serviço gratuitamente. Por que importa: Equipes que constroem IA física e sistemas de teleoperação atualmente gastam tempo significativo de GPU e esforço de engenharia no pré-processamento de dados de vídeo—um gargalo que a plataforma foi projetada para eliminar. Ao lidar com a infraestrutura de dados a montante, libera recursos computacionais e ciclos de engenharia para o trabalho de modelo central.
O que acompanhar: A oferta é limitada a laboratórios dispostos a fornecer feedback; equipes interessadas são convidadas a comentar ou enviar mensagem direta para discutir participação. Nenhum preço, data de disponibilidade ou cronograma de lançamento formal foi anunciado.
- 2
Midjourney adquire aplicativo de astrologia Co-Star
O que aconteceu: Midjourney, um laboratório de IA conhecido por geradores de imagens e vídeos, adquiriu o aplicativo de astrologia social Co-Star. Os termos do acordo não foram divulgados. A equipe de cerca de duas dúzias de funcionários da Co-Star se juntou à Midjourney. Por que importa: Co-Star tem cerca de 4,3 milhões de usuários ativos mensais e usa IA e redação humana para gerar horóscopos e avaliações de compatibilidade astrológica. A aquisição sinaliza a expansão da Midjourney além de seu negócio principal de geração de imagens para aplicativos voltados ao consumidor, seguindo seus esforços para construir divisões de medicina e spa.
O que acompanhar: Midjourney atualmente opera principalmente por meio do Discord, sem aplicativo independente. A experiência da equipe da Co-Star na construção de aplicativos para consumidores sugere que Midjourney pode finalmente desenvolver seu próprio aplicativo independente.
- 3
Black Forest Labs lança modelo multimodal FLUX 3 abrangendo vídeo, áudio e robótica
O que aconteceu: A Black Forest Labs anunciou o FLUX 3, um modelo multimodal unificado treinado em uma única arquitetura que realiza geração de imagem, vídeo, áudio e previsão de ações. A empresa também apresentou o FLUX-mimic, um modelo de robótica vídeo-ação construído sobre o FLUX 3 e testado com a Audi para implantação em fábrica real em uma única GPU local. Por que importa: O FLUX 3 reproduz e estende capacidades previamente demonstradas isoladamente por outros laboratórios de ponta (Gemini Omni, Grok Imagine, Seedance 2.0), com a equipe se comprometendo a abrir uma versão de pesos abertos para desenvolvedores. A aplicação em robótica sinala que a modelagem de mundo em vídeo pode se transferir diretamente para o controle robótico, potencialmente reduzindo barreiras para laboratórios que constroem modelos abertos competitivos sem dependência de ecossistemas fechados.
O que observar: FLUX 3 Video está atualmente em acesso antecipado. A capacidade do modelo de unificar controle de imagem, vídeo, áudio e robótica em uma única arquitetura—treinada conjuntamente em vez de como módulos separados—definirá se os sistemas multimodais se tornarão padrão industrial ou permanecerão fragmentados por tarefa.
- 4
Vídeos de IA Abalem a Confiança em Vídeos Reais Mesmo Quando Rotulados, Aponta Estudo
O que aconteceu: Pesquisadores realizaram um estudo em duas fases com cem participantes, comparando aqueles expostos a vídeos gerados por IA contra um grupo de controle que assistiu a vídeos gerados por humanos. O grupo exposto à IA depois visualizou conteúdo gerado por humanos junto com o grupo de controle e relatou dúvidas aumentadas sobre a autenticidade de vídeos subsequentes, confiança reduzida em seu julgamento, maior perturbação perceptiva e menor conectividade social — apesar da divulgação clara de que o conteúdo sintético era gerado por IA. Por que importa: Os achados revelam que simplesmente rotular vídeos gerados por IA não impede que eles minem a confiança dos espectadores em vídeos reais. Isso sugere que os efeitos psicológicos e perceptivos de ver conteúdo sintético realista se estendem até a filmagem genuína, mesmo quando os espectadores sabem a origem. Para plataformas e criadores de conteúdo, isso indica a necessidade de estratégias além da detecção e divulgação para proteger como as pessoas experimentam e confiam em mídia visual.
Ponto de atenção: A pesquisa evidencia que abordagens de design e política devem enfrentar os impactos experienciais e psicológicos da exposição a vídeos gerados por IA, não apenas focar em distinguir falso de real. O estudo foi apresentado na Conferência CHI 2026 sobre Fatores Humanos em Sistemas Computacionais.
- 5
Black Forest Labs lança Flux 3 com geração nativa de áudio e vídeo
O que aconteceu: A empresa alemã de IA Black Forest Labs lançou o Flux 3, um modelo de fundação multimodal que aprende com imagens, vídeos e áudio simultaneamente. O modelo pode gerar vídeos com áudio nativo de até 20 segundos de duração pela primeira vez, oferecendo suporte a texto-para-vídeo, imagem-para-vídeo, vídeo-para-vídeo, transições baseadas em quadros-chave, diálogo multilíngue e conexões orientadas por agentes entre clipes. Por que importa: Em avaliações iniciais usando clipes de 10 segundos em 720p, o Flux 3 foi preferido em relação a múltiplos concorrentes: 93% em comparação com Luma Ray 3.2, 77% em comparação com Runway Gen-4.5 e 69% em comparação com Grok Imagine Video. Contra concorrentes mais fortes, ficou nivelado ou próximo ao Seedance 2.0 e Gemini Omni Flash (ambos com 52% de preferência), que já atendem fluxos de trabalho de produção em larga escala. A BFL também desenvolveu Flux-mimic, um modelo de ação em vídeo sendo testado em tarefas de produção na Audi, sugerindo que a arquitetura se estende a aplicações de robótica.
O que acompanhar: Flux 3 Image está programado para ser lançado em acesso antecipado nas próximas semanas, com melhorias em prompts complexos e renderização de texto multilíngue. A previsão de ações será oferecida inicialmente através de parceiros selecionados. A BFL planeja acesso com pesos abertos ao backbone multimodal sob o nome 'Flux 3 Dev', com trabalho de longo prazo em um único modelo que combine previsão de percepção, ação e linguagem.
- 6
Criador produz filme longa-metragem usando LLM e o classifica como fracasso
O que aconteceu: Um criador de conteúdo utilizou um LLM (Claude Fable 5) para produzir uma adaptação cinematográfica em longa-metragem da obra The House on the Borderland de William Hope Hodgson, que foi enviada para seu canal no YouTube ao lado de videoclipes e álbuns gerados por IA. Por que é importante: O experimento testa se modelos de linguagem grandes conseguem sustentar a produção criativa ao longo de um projeto de longa duração sem intervenção humana — questão que se relaciona com quais tipos de trabalho criativo permanecem além das capacidades atuais da IA, mesmo quando há tempo e permissão para operar de forma independente.
O que acompanhar: O criador classifica o resultado como fracasso apesar de lançá-lo, observando que o avaliou apenas pelos padrões de canal do YouTube em vez de cinema como categoria completa; atribui a deficiência não à agência ou planejamento do LLM, mas a outros fatores que discute no artigo completo.
Em breve
Fique atento ao lançamento do Flux 3 Image nas próximas semanas e à evolução de modelos multimodais como o FLUX 3 Video, que podem redefinir se a inteligência artificial adota uma arquitetura unificada ou fragmentada por tarefa. Acompanhe também como a Midjourney pode migrar além do Discord com seu próprio aplicativo independente, e como pesquisas emergentes sobre os impactos psicológicos de vídeos gerados por IA devem moldar o design e as políticas do setor nos próximos anos.
Fontes
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free