AITodaySeu digest de notícias de IA

Video Generation

Jul 23, 2026

Video Generation

Resumo do dia

A Black Forest Labs lançou o Flux 3, um novo modelo capaz de gerar imagens, vídeos e áudio nativamente, expandindo as possibilidades criativas da inteligência artificial. Enquanto isso, a Runway apresentou o Media Router para orquestrar múltiplos modelos de IA generativa, e a Synthesia desenvolveu uma ferramenta de coaching com IA focada em treinamento empresarial. Apesar dos avanços tecnológicos, um criador documentou seu desafio ao produzir um longa-metragem usando LLM e modelos de vídeo, evidenciando que as limitações atuais ainda impõem obstáculos significativos ao processo criativo.

Principais notícias

  1. 1

    Black Forest Labs lança Flux 3 com geração nativa de áudio e vídeo

    O que aconteceu: A empresa alemã de IA Black Forest Labs lançou o Flux 3, um modelo de fundação multimodal que aprende com imagens, vídeo e áudio em conjunto. O modelo consegue gerar vídeos com áudio nativo de até 20 segundos pela primeira vez, suportando texto-para-vídeo, imagem-para-vídeo, vídeo-para-vídeo, transições baseadas em quadros-chave, diálogo multilíngue e ligações orientadas por agentes entre clipes. Por que importa: Em avaliações iniciais usando clipes de dez segundos em 720p, o Flux 3 foi preferido em relação a múltiplos concorrentes: 93 por cento sobre Luma Ray 3.2, 77 por cento sobre Runway Gen-4.5 e 69 por cento sobre Grok Imagine Video. Contra concorrentes mais fortes, igualou ou chegou perto de Seedance 2.0 e Gemini Omni Flash (cada um com 52 por cento de preferência), que já servem fluxos de trabalho de produção importantes. A BFL também desenvolveu Flux-mimic, um modelo de ação em vídeo sendo testado em tarefas de produção na Audi, sugerindo que a arquitetura se estende a aplicações de robótica.

    O que observar: Flux 3 Image está marcado para lançamento em acesso antecipado nas próximas semanas, com melhorias em prompts complexos e renderização de texto multilíngue. A previsão de ações será oferecida inicialmente através de parceiros selecionados. A BFL planeja acesso de peso aberto ao backbone multimodal sob o nome 'Flux 3 Dev', com trabalho de longo prazo em um único modelo combinando predição de percepção, ação e linguagem.

  2. 2

    Criador produz filme de longa-metragem usando LLM e o chama de fracasso

    O que aconteceu: Um criador de conteúdo utilizou um LLM (Claude Fable 5) para produzir uma adaptação cinematográfica de longa-metragem de The House on the Borderland, de William Hope Hodgson, que foi enviada para seu canal no YouTube junto com videoclipes e álbuns gerados por IA. Por que é importante: O experimento testa se modelos de linguagem grandes conseguem manter a produção criativa ao longo de um projeto de longa duração sem intervenção humana—uma questão que se relaciona com que tipos de trabalho criativo permanecem além das capacidades atuais da IA, mesmo quando lhe é dado tempo e permissão para operar de forma independente.

    O que observar: O criador enquadra o resultado como um fracasso apesar de tê-lo lançado, observando que o avaliou apenas pelos padrões do canal YouTube em vez de cinema como categoria inteira; ele atribui a deficiência não à agência ou ao planejamento do LLM, mas a outros fatores que discute no texto completo.

  3. 3

    Black Forest Labs lança FLUX 3 para geração de imagens, vídeos e áudio

    O que aconteceu: A Black Forest Labs lançou o FLUX 3, um modelo de IA multimodal que gera imagens e clipes de áudio/vídeo combinados de até vinte segundos a partir de um único comando. O modelo é treinado conjuntamente em imagens, vídeo e áudio, em vez de combinar modelos separados. Também se estende à visão robótica e ações. Por que é importante: O FLUX 3 representa o primeiro modelo público de geração de vídeos da empresa e apresenta a geração criativa, simulação, uso de computador e robótica como aplicações conectadas de uma única capacidade. A Black Forest Labs posiciona isso como "inteligência visual"—modelos que podem perceber, prever e agir em ambientes físicos e digitais—em vez de tratar cada modalidade como uma ferramenta separada.

    O que acompanhar: O FLUX 3 será oferecido através de quatro linhas de produtos: FLUX 3 Video, FLUX 3 Image e FLUX 3 Act. O lançamento é limitado inicialmente, o que significa que maior disponibilidade ou detalhes de preços podem ser anunciados em seguida.

  4. 4

    Runway lança Media Router para orquestrar modelos de IA generativa

    O que aconteceu: A Runway lançou o Media Router através da sua plataforma Runway Dev na quinta-feira, uma ferramenta que seleciona automaticamente o melhor modelo de geração de imagens, vídeos ou áudio para uma solicitação de desenvolvedor com base em prioridades como qualidade, velocidade ou custo. A Runway afirma que este é o primeiro roteador de modelos construído especificamente para mídia generativa. Por que é importante: Os modelos de mídia generativa explodiram em número, dificultando para os desenvolvedores avaliar novos lançamentos e entender qual modelo funciona melhor para cada tarefa. O roteador permite que desenvolvedores—incluindo Adobe, Cloudflare, ElevenLabs, Expedia, Shutterstock e Quora—integrem geração de mídia diretamente em seus produtos via API, enquanto a Runway se posiciona como uma camada de orquestração em vez de apostar em um único modelo permanecendo à frente.

    O que observar: Os desenvolvedores podem definir preferências para a lógica de seleção do roteador, incluindo preço de tokens (uma preocupação importante de custo em 2026 para empresas que usam IA agentic) e origem do modelo—por exemplo, priorizando fornecedores americanos em detrimento de modelos chineses, conforme a administração Trump explora possíveis proibições de modelos abertos de IA chineses.

  5. 5

    Synthesia lança ferramenta de coaching com IA para treinamento em vendas e liderança

    O que aconteceu: A startup britânica de IA Synthesia lançou na quarta-feira o Roleplay Sessions, um produto de treinamento interativo em que funcionários praticam conversas de alto risco—apresentações de vendas, avaliações de desempenho, reclamações de clientes—com um avatar de IA que responde, os desafia e avalia seu desempenho segundo uma rubrica. A empresa já conquistou clientes iniciais, incluindo uma das três maiores empresas europeias por capitalização de mercado, uma das cinco maiores da Fortune 100 e uma das maiores empresas de recrutamento do mundo. Por que importa: Synthesia está mudando o foco de geração de vídeos para provar que o treinamento realmente muda comportamentos. A maioria do treinamento corporativo informa e demonstra, mas não consegue impulsionar o aprendizado real; Synthesia argumenta que o avanço vem da prática combinada com feedback. Ao sobrepor rubricas, dados de desempenho e análises à sua tecnologia de avatar, a empresa se posiciona como uma plataforma de gestão de desempenho em vez de apenas um fornecedor de avatar com IA—um modelo de negócio mais defensável. O CEO Victor Riparbelli observa que quando uma equipe de vendas inteira pratica com um ator de IA, os gerentes podem coletar dados granulares sobre o desempenho geral da força de vendas.

    Fique atento: O Roleplay é atualmente uma oferta corporativa, mas Synthesia planeja expandir para pequenas empresas, prosumidores e potencialmente instituições educacionais nos próximos meses conforme os custos de inferência continuam caindo. A plataforma também é o primeiro lançamento dentro de um framework "Sessions" mais amplo que a empresa planeja estender para entrevistas de emprego e triagem de candidatos.

  6. 6

    Filmes de IA Simplificados: Como Um Desenvolvedor Criou um Longa-metragem Usando Claude e Modelos de Vídeo

    O que aconteceu: Um desenvolvedor usou Claude (uma IA que compreende e gera texto) combinada com Seedance 2.0 (um modelo de geração de vídeo) para criar um curta-metragem completo. O trabalho envolveu quinze iterações e um pipeline multietapas: começando com um prompt de história de duas páginas, evoluindo através de sessões de brainstorming com Claude, gerando imagens de referência para personagens e localizações, e então produzindo clipes de vídeo para cada cena usando prompts gerados por IA. Por que é importante: Isso demonstra que não-especialistas agora podem produzir conteúdo de qualidade cinematográfica combinando ferramentas de IA existentes sem necessidade de equipes de filmagem ou equipamentos caros. O autor mostrou que Claude Fable (uma variante de modelo mais recente) e Claude Opus (uma variante mais antiga) produziram qualidade de direção comparável quando testadas frente a frente, o que significa que o verdadeiro avanço é a cadeia de ferramentas acessível em si, e não um modelo de ruptura único.

    O que observar: O filme final está disponível no YouTube (https://www.youtube.com/watch?v=q40M08SOhGs). O pipeline usa Higgsfield como um wrapper de API para Seedance, nano banana para geração de imagens de referência, e Claude Code para roteirização—uma stack que parece reproduzível por outros interessados em cinema com IA.

Em breve

Fique atento ao lançamento do Flux 3 nas próximas semanas, que promete melhorias significativas em prompts complexos e renderização multilíngue, enquanto a BFL planeja disponibilizar o backbone multimodal 'Flux 3 Dev' em acesso aberto para desenvolvedores. Acompanhe também a expansão da Synthesia com sua plataforma Roleplay saindo do segmento corporativo para alcançar pequenas empresas e instituições educacionais, refletindo a tendência de democratização das ferramentas de IA generativa conforme os custos de inferência continuam reduzindo.

Fontes

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free