Video Generation
Jul 29, 2026

The Gist
mimic robotics-এর FLUX-mimic প্রযুক্তি Audi-তে রোবট প্রশিক্ষণের সময় ৩০ ঘণ্টা থেকে মাত্র ৩০ মিনিটে কমিয়ে এনেছে, যখন Black Forest Labs নতুন FLUX 3 মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবটিক্স জুড়ে কাজ করে। Runway ভিডিও AI-এর একটি বাগকে নতুন বৈশিষ্ট্যে রূপান্তরিত করেছে এবং একটি নতুন স্ব-কেন্দ্রিক ভিডিও প্রক্রিয়াকরণ প্ল্যাটফর্ম চালু হয়েছে। তবে গবেষণা দেখাচ্ছে যে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করা সম্ভব হলেও এটি মানুষের বাস্তব ভিডিওতে আস্থা কমিয়ে দিচ্ছে।
Today's Stories
- 1
mimic robotics, Audi-তে FLUX-mimic মোতায়েন করে রোবট প্রশিক্ষণ সময় ৩০ ঘণ্টা থেকে ৩০ মিনিটে নামিয়ে আনল
কী ঘটেছে: mimic robotics, Black Forest Labs-এর FLUX 3 ভিডিও মডেল দিয়ে তৈরি একটি Video-Action Model FLUX-mimic প্রবর্তন করেছে, যা রোবটগুলিকে মাত্র ৩০ মিনিটের রোবট ডেটা থেকে জটিল হেরফের কাজ শিখতে সক্ষম করে, যার পরিবর্তে ৩০ ঘণ্টা বা তার বেশি সময় লাগত। কোম্পানিটি ইতিমধ্যে অটোমোটিভ উৎপাদনে নমনীয়, সূক্ষ্ম-হেরফেরমূলক কাজ স্বয়ংক্রিয় করতে Audi-র সাথে সিস্টেম মোতায়েন করছে। এটি কেন গুরুত্বপূর্ণ: নমনীয় যন্ত্রাংশ এবং সূক্ষ্ম হেরফেরের সাথে জড়িত উৎপাদন কাজগুলি দশকের রোবোটিক্স বিনিয়োগ সত্ত্বেও ম্যানুয়াল থেকেই গেছে, কারণ প্রচলিত পদ্ধতিতে প্রোগ্রাম করা রোবট ঘরগুলি উৎপাদন ভেরিয়েন্টের জন্য পুনর্প্রকৌশল করতে খুবই ব্যয়বহুল। FLUX-mimic-র ভিডিও বোঝাপড়া থেকে স্থির ছবি থেকে নয়, বরং ভৌত গতিবিদ্যা শিখতে পারার ক্ষমতা Audi-র মতো কারখানাগুলিকে মাসব্যাপী প্রকৌশল প্রচেষ্টা ছাড়াই আগে থেকে অসম্ভব বলে মনে হওয়া কাজগুলি স্বয়ংক্রিয় করতে দেয়, যা স্মার্ট কারখানার Audi-র দৃষ্টিভঙ্গির সাথে সামঞ্জস্যপূর্ণ, যেখানে রোবটগুলি পুনরাবৃত্তিমূলক এবং শারীরিক দৃষ্টিতে দাবিদার কাজে কর্মচারীদের সাথে অংশীদারিত্ব করে।
নজরে রাখতে হবে: Audi-র উৎপাদন পরিবেশগুলি ইতিমধ্যে নরম-বডি হেরফেরের কাজে FLUX-mimic পরীক্ষা ও মোতায়েন করছে, যা Audi বলে প্রচলিত রোবোটিক্সের সাথে অসম্ভব হত। অংশীদারিত্বটি প্রমাণ করার লক্ষ্য রাখে যে সিস্টেমটি বিস্তৃত সংহতকরণ ব্যয়ভার ছাড়াই বাস্তব উৎপাদন লাইনে অসংগঠিত কাজগুলি নির্ভরযোগ্যভাবে সামলাতে পারে।
- 2
Runwayが動画AIのバグを機能に変身させた
Runwayは、リアルタイム動画生成中にAI生成アバターが画面外に流れるバグを数週間かけて修正しようとしましたが、最終的にはバグを回避するフロントエンド機能として実装しました。Runway MLのエンタープライズプロダクト責任者Ryan Phillipsは、VB Transform 2026でこの事例を紹介し、基礎モデルを構築していない企業でも、Runwayがモデルをどのように構築・評価・提供しているかを学ぶことが有用だと述べました。 Runwayは一般的な世界モデルを構築する応用AI研究企業で、リアルタイム動画モデル「Runway Characters」でAI生成アバターとのゼロレイテンシ双方向対話を実現しています。5年前にはそのような技術は実現不可能だったとされており、この進展は、技術企業がエンジニアリング上の課題にどう対応するか、実用的な教訓を示しています。
Phillipsの発言によれば、基礎モデルを自社で構築していない企業であっても、Runwayの設計・評価・製品化の手法から学べる教訓がほぼすべて適用可能だということです。
- 3
আত্মকেন্দ্রিক ভিডিও প্রক্রিয়াকরণ প্ল্যাটফর্ম চালু, ল্যাব অংশীদার খুঁজছে
কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা আত্মকেন্দ্রিক এবং স্থানীয় ভিডিওর জন্য ডেটা প্রস্তুতি (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল উন্নয়নের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দলটি গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য প্রকাশ্যে নিয়োগ করছে। এটি কেন গুরুত্বপূর্ণ: ফিজিক্যাল এআই এবং টেলিঅপারেশন সিস্টেম তৈরিকারী দল বর্তমানে ভিডিও ডেটা প্রি-প্রসেসিং-এ উল্লেখযোগ্য GPU সময় এবং প্রকৌশল প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা পাইপলাইন পরিচালনা আপস্ট্রিমে করে, এটি গণনামূলক সংস্থান এবং প্রকৌশল চক্র মূল মডেল কাজের জন্য মুক্ত করে।
নজরে রাখার মতো বিষয়: অফারটি প্রতিক্রিয়া প্রদানের জন্য ইচ্ছুক ল্যাবগুলির মধ্যে সীমাবদ্ধ; আগ্রহী দলগুলি অংশগ্রহণ আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রিত হয়েছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক চালু সময়সূচী উল্লেখ করা হয়নি।
- 4
Midjourney অধিগ্রহণ করেছে জ্যোতিষ অ্যাপ Co-Star
কী ঘটেছে: ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত এআই ল্যাব Midjourney সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star-এর প্রায় দুই ডজন কর্মচারীর দল Midjourney-তে যোগদান করেছে। এটি গুরুত্বপূর্ণ কেন: Co-Star-এর প্রায় ৪.৩ মিলিয়ন মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি জ্যোতিষ পূর্বাভাস এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে এআই এবং মানুষের লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney-র মূল ছবি-উৎপাদন ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপ্লিকেশনে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ গড়ে তোলার প্রচেষ্টা অনুসরণ করে।
লক্ষ্য রাখার বিষয়: Midjourney বর্তমানে প্রাথমিকভাবে Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দলের ভোক্তা অ্যাপ্লিকেশন নির্মাণে অভিজ্ঞতা পরামর্শ দেয় যে Midjourney অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন বিকাশ করতে পারে।
- 5
Black Forest Labs চালু করেছে FLUX 3 মাল্টিমোডাল মডেল যা ভিডিও, অডিও, রোবটিক্স জুড়ে বিস্তৃত
কী ঘটেছে: Black Forest Labs ঘোষণা করেছে FLUX 3, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও উৎপাদন এবং অ্যাকশন প্রেডিকশন পরিচালনা করে। কোম্পানি আরও অনাবৃত করেছে FLUX-mimic, একটি ভিডিও-অ্যাকশন রোবটিক্স মডেল যা FLUX 3-এর উপর নির্মিত এবং Audi-এর সাথে একটি একক অন-প্রিমিসেস GPU-তে রিয়েল ফ্যাক্টরি স্থাপনার জন্য পরীক্ষিত। এটি কেন গুরুত্বপূর্ণ: FLUX 3 এমন ক্ষমতা পুনরুৎপাদন এবং প্রসারিত করে যা অন্যান্য অগ্রণী ল্যাব দ্বারা আগে আলাদাভাবে প্রদর্শিত হয়েছিল (Gemini Omni, Grok Imagine, Seedance 2.0), দলটি একটি ওপেন-ওয়েইটস ডেভেলপার সংস্করণ খোলার জন্য প্রতিশ্রুতিবদ্ধ। রোবটিক্স প্রয়োগটি সংকেত দেয় যে ভিডিও বিশ্ব মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভাব্যভাবে বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরিকারী ল্যাবগুলির জন্য বাধা কমাতে পারে।
যা লক্ষ্য করতে হবে: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। মডেলটির ছবি, ভিডিও, অডিও এবং রোবটিক্স নিয়ন্ত্রণকে একটি আর্কিটেকচারে একীভূত করার ক্ষমতা—যা যৌথভাবে প্রশিক্ষিত, পৃথক মডিউল হিসাবে নয়—এটি নির্ধারণ করবে যে মাল্টিমোডাল সিস্টেমগুলি শিল্পের মান হয়ে উঠবে নাকি কাজের দ্বারা বিভক্ত থাকবে।
- 6
কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করা থাকলেও বাস্তব ভিডিওতে আস্থা কমায়, গবেষণা বলছে
কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীকে নিয়ে দুই পর্যায়ের গবেষণা পরিচালনা করেছেন। এক গ্রুপকে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও দেখানো হয়েছিল, আরেক নিয়ন্ত্রণ গ্রুপকে মানুষের দ্বারা তৈরি ভিডিও দেখানো হয়েছিল। কৃত্রিম বুদ্ধিমত্তা-এক্সপোজার গ্রুপ তারপর মানুষের দ্বারা তৈরি বিষয়বস্তু দেখেছে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারের প্রতি আস্থা হ্রাস, উচ্চতর উপলব্ধিগত ব্যাঘাত এবং নিম্নতর সামাজিক সংযোগ রিপোর্ট করেছে—যদিও সংশ্লেষিত বিষয়বস্তু কৃত্রিম বুদ্ধিমত্তা-উত্পাদিত হওয়ার স্পষ্ট প্রকাশ ছিল। কেন এটি গুরুত্বপূর্ণ: গবেষণার ফলাফলগুলি প্রকাশ করে যে কৃত্রিম বুদ্ধিমত্তা-তৈরি ভিডিওগুলি চিহ্নিত করা বাস্তব ভিডিওগুলিতে দর্শকদের আস্থা হ্রাস করা থেকে রক্ষা করে না। এটি প্রস্তাব করে যে বাস্তবসম্মত সংশ্লেষিত বিষয়বস্তু দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিগত প্রভাবগুলি প্রকৃত ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎসটি জানেন। প্ল্যাটফর্ম এবং বিষয়বস্তু নির্মাতাদের জন্য, এটি নির্দেশ এবং প্রকাশের বাইরে কৌশলগুলির প্রয়োজনীয়তা নির্দেশ করে যাতে মানুষ কীভাবে চাক্ষুষ মাধ্যম অনুভব এবং বিশ্বাস করে তা রক্ষা করা যায়।
যা পর্যবেক্ষণ করতে হবে: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই কৃত্রিম বুদ্ধিমত্তা-তৈরি ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সম্বোধন করতে হবে, শুধুমাত্র নকল থেকে বাস্তবকে আলাদা করার উপর দৃষ্টি নিবদ্ধ করতে হবে না। গবেষণাটি দুই হাজার ছাব্বিশ সালের CHI কম্পিউটিং সিস্টেমে মানব কারণক সম্মেলনে উপস্থাপন করা হয়েছিল।
What to Watch
আগামী দিনগুলিতে আমরা দেখব কীভাবে Audi-এর মতো উৎপাদন কোম্পানিগুলি FLUX-এর মতো ভিডিও প্রযুক্তিকে বাস্তব কারখানার কাজে প্রয়োগ করছে এবং এর মাধ্যমে রোবটিক্স পুনর্সংজ্ঞায়িত করছে। একই সময়ে, FLUX 3 Video এবং অন্যান্য মাল্টিমোডাল সিস্টেমগুলি শিল্প মানদণ্ড হয়ে উঠবে কি না তা নির্ভর করবে এই প্রযুক্তিগুলি নকল-বনাম-বাস্তব সনাক্তকরণের বাইরে মানুষের মনস্তাত্ত্বিক এবং নৈতিক চিন্তাভাবনাগুলিকে কতটা সফলভাবে সামলাতে পারে তার উপর।
Sources
- mimic robotics introduces ‘frontier video-action models’ to the factory floor at Audi
- Runway couldn't fix a bug in its AI video model, so it turned the bug into a feature
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free