Video Generation
Jul 28, 2026

Resumo do dia
A Runway transformou um bug em um novo recurso de avatar de IA, enquanto Black Forest Labs lançou o modelo multimodal FLUX 3 com capacidades nativas de geração de vídeo e áudio. Paralelamente, um estudo alerta que vídeos gerados por IA estão abalando a confiança em vídeos reais mesmo quando devidamente rotulados, levantando questões sobre autenticidade no conteúdo visual.
Principais notícias
- 1
Runway transformou bug em recurso de avatar de IA
O que aconteceu: A Runway gastou semanas tentando corrigir um problema técnico em seu modelo de vídeo em tempo real — avatares de IA gerados se deslocavam do centro durante a geração — mas, em vez de consertar o código interno, criou um novo recurso de interface que contornou o problema. Por que é importante: Ryan Phillips, chefe de produto empresarial da Runway ML, apresentou essa experiência na VB Transform 2026 como uma lição aplicável além de empresas que desenvolvem modelos de fundação. A abordagem exemplifica como a Runway constrói, avalia e lança produtos de IA — um processo que Phillips argumenta ser relevante para empresas em geral.
O que acompanhar: O Runway Characters, modelo de vídeo em tempo real que permite interações de latência zero com avatares de IA gerados, é o principal resultado dessa filosofia de desenvolvimento. Cinco anos atrás, criar esse tipo de sistema teria sido muito mais desafiador.
- 2
Plataforma de processamento de vídeo egocêntrico é lançada e busca parceiros em laboratórios
O que aconteceu: Uma startup desenvolveu uma plataforma que automatiza o pipeline de preparação de dados (ETL) para vídeo egocêntrico e espacial, convertendo gravações brutas em saídas prontas para modelos em robótica e desenvolvimento de modelos de visão-linguagem-ação (VLA). A equipe está aberta a recrutar laboratórios de pesquisa e empresas para testar o serviço gratuitamente. Por que importa: Equipes que desenvolvem IA física e sistemas de teleoperação atualmente gastam tempo significativo de GPU e esforço de engenharia no pré-processamento de dados de vídeo — um gargalo que a plataforma foi projetada para eliminar. Ao lidar com a infraestrutura de dados a montante, libera recursos computacionais e ciclos de engenharia para o trabalho central do modelo.
O que observar: A oferta é limitada a laboratórios dispostos a fornecer feedback; equipes interessadas são convidadas a comentar ou enviar mensagens diretas para discutir participação. Nenhum preço, data de disponibilidade ou cronograma formal de lançamento é informado.
- 3
Midjourney adquire aplicativo de astrologia Co-Star
O que aconteceu: Midjourney, um laboratório de IA conhecido por geradores de imagens e vídeos, adquiriu o aplicativo de astrologia social Co-Star. Os termos do acordo não foram divulgados. O time de cerca de duas dúzias de funcionários da Co-Star se juntou à Midjourney. Por que importa: Co-Star tem aproximadamente 4,3 milhões de usuários ativos mensais e utiliza IA e redação humana para gerar horóscopos e avaliações de compatibilidade astrológica. A aquisição sinaliza a expansão da Midjourney além de seu negócio central de geração de imagens para aplicativos voltados ao consumidor, após seus esforços para construir divisões de medicina e spa.
O que observar: Midjourney opera atualmente principalmente através do Discord sem um aplicativo independente. A experiência do time da Co-Star em criar aplicativos para consumidores sugere que Midjourney pode finalmente desenvolver sua própria aplicação independente.
- 4
Black Forest Labs lança modelo multimodal FLUX 3 abrangendo vídeo, áudio e robótica
O que aconteceu: A Black Forest Labs anunciou o FLUX 3, um modelo multimodal unificado treinado em uma única arquitetura que realiza geração de imagem, vídeo, áudio e previsão de ações. A empresa também apresentou o FLUX-mimic, um modelo de robótica vídeo-ação construído sobre o FLUX 3 e testado com a Audi para implantação em fábrica real em uma única GPU local. Por que importa: O FLUX 3 reproduz e estende capacidades previamente demonstradas separadamente por outros laboratórios de ponta (Gemini Omni, Grok Imagine, Seedance 2.0), com o time se comprometendo a abrir uma versão de desenvolvedor com pesos abertos. A aplicação em robótica sinaliza que modelagem de mundo em vídeo pode ser transferida diretamente para controle robótico, potencialmente reduzindo barreiras para laboratórios que constroem modelos abertos competitivos sem dependência de ecossistemas fechados.
O que observar: O FLUX 3 Video está atualmente em acesso antecipado. A capacidade do modelo de unificar controle de imagem, vídeo, áudio e robótica em uma única arquitetura — treinada conjuntamente em vez de como módulos separados — determinará se sistemas multimodais se tornam padrão da indústria ou permanecem fragmentados por tarefa.
- 5
Vídeos de IA Abalacam a Confiança em Vídeos Reais Mesmo Quando Rotulados, Aponta Estudo
O que aconteceu: Pesquisadores conduziram um estudo em duas fases com cem participantes, comparando aqueles expostos a vídeos gerados por IA com um grupo de controle que assistiu a vídeos gerados por humanos. O grupo exposto à IA então visualizou conteúdo gerado por humanos juntamente com o grupo de controle e relatou maior dúvida sobre a autenticidade de vídeos subsequentes, redução da confiança em seu julgamento, maior perturbação perceptual e menor conectividade social — apesar da divulgação clara de que o conteúdo sintético era gerado por IA. Por que importa: Os achados revelam que simplesmente rotular vídeos gerados por IA não previne que eles minem a confiança dos espectadores em vídeos reais. Isso sugere que os efeitos psicológicos e perceptuais de ver conteúdo sintético realista se transferem para material genuíno, mesmo quando os espectadores conhecem a fonte. Para plataformas e criadores de conteúdo, isso indica a necessidade de estratégias além da detecção e divulgação para proteger como as pessoas experimentam e confiam em mídia visual.
O que observar: A pesquisa destaca que abordagens de design e políticas devem abordar os impactos experienciais e psicológicos da exposição a vídeos gerados por IA, não apenas focar em distinguir fake de real. O estudo foi apresentado na Conferência CHI de 2026 sobre Fatores Humanos em Sistemas Computacionais.
- 6
Black Forest Labs lança Flux 3 com geração nativa de áudio e vídeo
O que aconteceu: A empresa alemã de IA Black Forest Labs lançou o Flux 3, um modelo de fundação multimodal que aprende com imagens, vídeos e áudio em conjunto. O modelo consegue gerar vídeos com áudio nativo de até 20 segundos de duração pela primeira vez, suportando texto-para-vídeo, imagem-para-vídeo, vídeo-para-vídeo, transições baseadas em keyframes, diálogo multilíngue e ligações orientadas por agentes entre clipes. Por que importa: Em avaliações iniciais com clipes de 10 segundos em 720p, o Flux 3 foi preferido em relação a múltiplos concorrentes: 93% em comparação com Luma Ray 3.2, 77% em comparação com Runway Gen-4.5 e 69% em comparação com Grok Imagine Video. Contra concorrentes mais fortes, correspondeu ou chegou perto do Seedance 2.0 e Gemini Omni Flash (ambos com 52% de preferência), que já servem grandes fluxos de produção. A BFL também desenvolveu Flux-mimic, um modelo de ação em vídeo que está sendo testado em tarefas de produção na Audi, sugerindo que a arquitetura se estende para aplicações de robótica.
O que observar: Flux 3 Image está previsto para lançamento em acesso antecipado nas próximas semanas, com melhorias para prompts complexos e renderização de texto multilíngue. A previsão de ações será inicialmente oferecida por meio de parceiros selecionados. A BFL planeja oferecer acesso de peso aberto ao backbone multimodal sob o nome 'Flux 3 Dev', com trabalho de longo prazo em um único modelo que combine previsão de percepção, ação e linguagem.
Em breve
Acompanhe o Runway Characters, um modelo de vídeo em tempo real que permite interações com avatares de IA sem latência, enquanto o FLUX 3 Video avança em acesso antecipado com sua arquitetura unificada para controle de imagem, vídeo, áudio e robótica — dois desenvolvimentos que podem redefinir como os sistemas de IA multimodal funcionam na indústria. Observe também o possível lançamento de um aplicativo independente do Midjourney e como pesquisas sobre os impactos psicológicos de vídeos gerados por IA influenciarão o design e as políticas futuras desses sistemas.
Fontes
- Runway couldn't fix a bug in its AI video model, so it turned the bug into a feature
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free