AITodaySeu digest de notícias de IA

Video Generation

Jul 29, 2026

Video Generation

Resumo do dia

A geração de vídeo por IA avança rapidamente com lançamentos como o modelo multimodal FLUX 3 da Black Forest Labs, que agora integra vídeo, áudio e robótica, enquanto a mimic robotics reduz drasticamente o tempo de treinamento de robôs ao implantar FLUX-mimic na Audi. Paralelamente, empresas como Runway transformam desafios técnicos em recursos úteis, mas um novo estudo revela preocupação crescente: vídeos gerados por IA abalam a confiança nas imagens reais mesmo quando claramente identificados como artificiais.

Principais notícias

  1. 1

    mimic robotics implanta FLUX-mimic na Audi, reduzindo treinamento de robôs de 30 horas para 30 minutos

    O que aconteceu: a mimic robotics apresentou FLUX-mimic, um Video-Action Model construído com o modelo de vídeo FLUX 3 da Black Forest Labs, que permite que robôs aprendam tarefas complexas de manipulação com apenas 30 minutos de dados de robô em vez de 30 ou mais horas. A empresa já está implantando o sistema na Audi para automatizar trabalho flexível de manipulação fina na produção automotiva. Por que importa: tarefas de manufatura envolvendo peças flexíveis e manipulação fina permaneceram manuais apesar de décadas de investimento em robótica, porque células de robôs convencionalmente programadas são muito caras para re-engenharia visando variantes de produção. A capacidade da FLUX-mimic de aprender a partir da compreensão em vídeo da dinâmica física em vez de imagens estáticas permite que fábricas como a Audi automatizem tarefas anteriormente intratáveis sem meses de esforço de engenharia, alinhando-se à visão da Audi de fábricas inteligentes onde robôs trabalham em parceria com colaboradores em trabalho repetitivo e fisicamente exigente.

    O que observar: os ambientes de produção da Audi já estão testando e implantando FLUX-mimic em trabalho de manipulação de corpos moles que a Audi afirma seria impossível com robótica convencional. A parceria visa provar que o sistema consegue lidar com tarefas não estruturadas de forma confiável em linhas de produção reais sem overhead extenso de integração.

  2. 2

    Runway transforma bug em recurso: avatares descentrados viram feature

    O que aconteceu: A Runway enfrentou semanas tentando corrigir um bug em seu modelo de vídeo em tempo real — avatares gerados por IA saíam do centro durante a geração. Em vez de um patch técnico, a empresa criou um recurso front-end que contornou o problema. Ryan Phillips, chefe de produto empresarial da Runway ML, compartilhou essa lição na VB Transform 2026. Por que é importante: A abordagem ilustra como empresas de IA lidam com limitações técnicas de forma criativa — transformando obstáculos em funcionalidades. Phillips argumentou que mesmo companhias que não constroem modelos de linguagem por conta própria podem aprender com a forma como a Runway desenvolve, avalia e lança seus produtos.

    O que observar: A Runway apresentou Runway Characters, um modelo de vídeo em tempo real que permite interações com latência zero entre usuários e avatares gerados por IA — uma capacidade que, cinco anos atrás, teria levado muito mais tempo para criar.

  3. 3

    Plataforma de processamento de vídeo egocêntrico é lançada e busca parceiros em laboratórios

    O que aconteceu: Uma startup desenvolveu uma plataforma que automatiza o pipeline de preparação de dados (ETL) para vídeo egocêntrico e espacial, convertendo gravações brutas em saídas prontas para modelos de robótica e desenvolvimento de modelos de visão-linguagem-ação (VLA). A equipe está recrutando abertamente laboratórios de pesquisa e empresas para testar o serviço gratuitamente. Por que importa: Equipes que desenvolvem IA física e sistemas de teleoperação atualmente gastam tempo significativo de GPU e esforço de engenharia no pré-processamento de dados de vídeo — um gargalo que a plataforma foi projetada para eliminar. Ao lidar com a infraestrutura de dados a montante, ela libera recursos computacionais e ciclos de engenharia para o trabalho central do modelo.

    O que observar: A oferta é limitada a laboratórios dispostos a fornecer feedback; equipes interessadas são convidadas a comentar ou enviar mensagens diretas para discutir participação. Não há preço, data de disponibilidade ou cronograma formal de lançamento declarados.

  4. 4

    Midjourney adquire aplicativo de astrologia Co-Star

    O que aconteceu: A Midjourney, laboratório de IA conhecido por geradores de imagem e vídeo, adquiriu o aplicativo de astrologia social Co-Star. Os termos do acordo não foram divulgados. O time da Co-Star, formado por cerca de duas dúzias de funcionários, se uniu à Midjourney. Por que importa: A Co-Star possui aproximadamente 4,3 milhões de usuários ativos mensais e utiliza IA e redação humana para gerar horóscpos e avaliações de compatibilidade astrológica. A aquisição sinaliza a expansão da Midjourney além de seu negócio principal de geração de imagens em direção a aplicativos voltados para o consumidor, acompanhando seus esforços para construir divisões médicas e de spa.

    O que acompanhar: A Midjourney atualmente opera principalmente por meio do Discord sem aplicativo independente. A experiência do time da Co-Star na construção de aplicativos para consumidor sugere que a Midjourney pode finalmente desenvolver sua própria aplicação independente.

  5. 5

    Black Forest Labs lança modelo multimodal FLUX 3 abrangendo vídeo, áudio e robótica

    O que aconteceu: A Black Forest Labs anunciou o FLUX 3, um modelo multimodal unificado treinado em uma única arquitetura que realiza geração de imagem, vídeo, áudio e previsão de ações. A empresa também apresentou o FLUX-mimic, um modelo de robótica vídeo-ação construído sobre o FLUX 3 e testado com a Audi para implantação real em fábrica em uma única GPU local. Por que importa: O FLUX 3 reproduz e estende capacidades anteriormente demonstradas separadamente por outros laboratórios de fronteira (Gemini Omni, Grok Imagine, Seedance 2.0), com o time se comprometendo a abrir uma versão de desenvolvedor com pesos abertos. A aplicação em robótica sinaliza que a modelagem de mundo em vídeo pode se transferir diretamente para controle de robôs, potencialmente reduzindo barreiras para laboratórios que constroem modelos abertos competitivos sem dependência de ecossistemas fechados.

    O que observar: O FLUX 3 Video está atualmente em acesso antecipado. A capacidade do modelo de unificar controle de imagem, vídeo, áudio e robótica em uma única arquitetura — treinada conjuntamente em vez de como módulos separados — determinará se sistemas multimodais se tornam padrão da indústria ou permanecem fragmentados por tarefa.

  6. 6

    Vídeos de IA Abalam a Confiança em Vídeos Reais Mesmo Quando Identificados, Aponta Estudo

    O que aconteceu: Pesquisadores conduziram um estudo em duas fases com 100 participantes comparando aqueles expostos a vídeos gerados por IA contra um grupo de controle que assistiu a vídeos gerados por humanos. O grupo exposto à IA então assistiu a conteúdo gerado por humanos junto com o grupo de controle e relatou maior dúvida sobre a autenticidade de vídeos subsequentes, confiança reduzida em seu julgamento, maior perturbação perceptual e menor conexão social — apesar da divulgação clara de que o conteúdo sintético era gerado por IA. Por que importa: Os achados revelam que simplesmente identificar vídeos gerados por IA não impede que eles minarem a confiança dos espectadores em vídeos reais. Isso sugere que os efeitos psicológicos e perceptuais de ver conteúdo sintético realista se estendem para a gravação genuína, mesmo quando os espectadores conhecem a fonte. Para plataformas e criadores de conteúdo, isso indica a necessidade de estratégias além de detecção e divulgação para proteger como as pessoas experimentam e confiam na mídia visual.

    O que observar: A pesquisa destaca que abordagens de design e políticas devem abordar os impactos experienciais e psicológicos da exposição a vídeos gerados por IA, não apenas focar em distinguir falso de real. O estudo foi apresentado na Conferência CHI 2026 sobre Fatores Humanos em Sistemas Computacionais.

Em breve

Acompanhe de perto se a Audi conseguirá validar o FLUX-mimic em linhas de produção reais para tarefas complexas de manipulação, enquanto a Runway Characters e o FLUX 3 Video competem para definir se sistemas multimodais verdadeiramente integrados — com controle unificado de imagem, vídeo, áudio e robótica — se tornarão o padrão da indústria ou permanecerão fragmentados. Simultaneamente, observe se a Midjourney finalmente lançará um aplicativo independente fora do Discord e se a comunidade científica conseguirá influenciar políticas que abordem não apenas a autenticação de vídeos gerados por IA, mas também seus impactos psicológicos e experienciais nos usuários.

Fontes

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free