Video Generation
Jul 28, 2026

The Gist
আজকের ভিডিও জেনারেশন খবরে Black Forest Labs তাদের নতুন FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স সাপোর্ট করে, যখন Midjourney Co-Star অধিগ্রহণ করেছে এবং AI ভিডিও প্রযুক্তিতে নতুন সম্ভাবনা তৈরি করছে। একই সময়ে গবেষণায় দেখা গেছে যে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করার প্রযুক্তি থাকলেও মানুষ বাস্তব ভিডিওর প্রতি আস্থা হারাচ্ছে, যা এই প্রযুক্তির নৈতিক দিক তুলে ধরে।
Today's Stories
- 1
Runwayのバグ、新機能に変身 AI動画モデルの工学的教訓
Runwayは、リアルタイム動画生成でAI生成アバターが画面中央からずれるバグを数週間かけて修正しようとしていました。しかし最終的には、バックエンド修正ではなく、フロントエンドでこの問題を回避する新機能として実装することで対応しました。 Runway MLのエンタープライズ製品責任者Ryan Phillipsは、VB Transform 2026でこの事例を紹介し、基盤モデルを自社開発していない企業でも、Runwayの構築・評価・リリースのアプローチから学べることが多いと述べました。これはAI企業だけでなく、広く組織がAIツールを開発・運用する際の実践的教訓を示しています。
Runway Charactersはリアルタイム動画モデルで、AI生成アバターとのゼロレイテンシー双方向インタラクションを可能にしています。
- 2
ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু হয়েছে, ল্যাব পার্টনার খুঁজছে
কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা ইগোসেন্ট্রিক এবং স্পেশাল ভিডিওর জন্য ডেটা প্রিপারেশন (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য মডেল-রেডি আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য খোলাভাবে নিয়োগ দিচ্ছে। এটি কেন গুরুত্বপূর্ণ: ফিজিক্যাল AI এবং টেলিঅপারেশন সিস্টেম তৈরি করা টিমগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং ইঞ্জিনিয়ারিং প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। আপস্ট্রিমে ডেটা পরিচালনা সামলিয়ে, এটি কম্পিউটেশনাল সম্পদ এবং ইঞ্জিনিয়ারিং চক্র মূল মডেল কাজের জন্য মুক্ত করে।
কী দেখতে হবে: অফারটি প্রতিক্রিয়া প্রদান করতে ইচ্ছুক ল্যাবগুলির জন্য সীমাবদ্ধ; আগ্রহী টিমগুলিকে অংশগ্রহণ নিয়ে আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনো মূল্য নির্ধারণ, প্রাপ্যতার তারিখ বা আনুষ্ঠানিক লঞ্চের সময়সীমা উল্লেখ করা হয়নি।
- 3
Midjourney এর Co-Star অধিগ্রহণ
কী ঘটেছে: ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত AI ল্যাব Midjourney সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star এর প্রায় দুই ডজন কর্মচারীর দল Midjourney এ যোগ দিয়েছে। এটি গুরুত্বপূর্ণ কেন: Co-Star এর প্রায় ৪.৩ মিলিয়ন মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি জ্যোতিষ পূর্বাভাস এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে AI এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণটি Midjourney এর মূল ছবি-জেনারেশন ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপ্লিকেশনে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ তৈরির প্রচেষ্টা অনুসরণ করে।
যা লক্ষ্য রাখতে হবে: Midjourney বর্তমানে প্রধানত Discord এর মাধ্যমে কাজ করে এবং কোনো স্বাধীন অ্যাপ নেই। Co-Star এর দলের ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা পরামর্শ দেয় যে Midjourney অবশেষে তার নিজস্ব স্বাধীন অ্যাপ্লিকেশন তৈরি করতে পারে।
- 4
Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স সমর্থন করে
কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, এটি একটি একীভূত মাল্টিমোডাল মডেল যা একক স্থাপত্যে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও জেনারেশন এবং অ্যাকশন প্রেডিকশন পরিচালনা করে। কোম্পানিটি FLUX-mimic ও উন্মোচন করেছে, যা FLUX 3 এর উপর নির্মিত একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল এবং Audi এর সাথে পরীক্ষা করা হয়েছে একটি একক অন-প্রিমাইসেস GPU তে বাস্তব কারখানা স্থাপনার জন্য। কেন এটি গুরুত্বপূর্ণ: FLUX 3 পূর্বে অন্যান্য অগ্রগামী ল্যাবস (Gemini Omni, Grok Imagine, Seedance 2.0) দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতা পুনরুৎপাদন এবং সম্প্রসারণ করে, দলটি একটি ওপেন-ওয়েট ডেভেলপার সংস্করণ খোলার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স প্রয়োগটি ইঙ্গিত করে যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভাব্যভাবে বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরি করা ল্যাবসের জন্য বাধা কমায়।
লক্ষ্য রাখতে হবে: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। মডেলটির একটি স্থাপত্যে ছবি, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণ একীভূত করার ক্ষমতা—যৌথভাবে প্রশিক্ষিত পৃথক মডিউল হিসাবে নয়—এটি আকার দেবে যে মাল্টিমোডাল সিস্টেম শিল্প মান হয়ে উঠবে নাকি কাজ দ্বারা খণ্ডিত থাকবে।
- 5
কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করা থাকলেও বাস্তব ভিডিওর প্রতি আস্থা কমায়, গবেষণায় দেখা গেছে
কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীর সাথে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন যেখানে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও দেখা গ্রুপকে মানুষের তৈরি ভিডিও দেখা নিয়ন্ত্রণ গ্রুপের সাথে তুলনা করা হয়েছে। কৃত্রিম বুদ্ধিমত্তা এক্সপোজার গ্রুপ পরবর্তীতে মানুষের তৈরি কন্টেন্ট দেখেছে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে অধিক সন্দেহ প্রকাশ করেছে, তাদের বিচারে আস্থা হ্রাস পেয়েছে, উচ্চতর উপলব্ধিগত বিঘ্ন এবং নিম্নতর সামাজিক সংযোগ অনুভব করেছে—যদিও কৃত্রিম সামগ্রীটি কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি তা স্পষ্টভাবে প্রকাশ করা হয়েছিল। কেন এটি গুরুত্বপূর্ণ: গবেষণাফল প্রকাশ করে যে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিওগুলি লেবেল করা বাস্তব ভিডিওর প্রতি দর্শকদের আস্থা ভেঙে দেওয়া থেকে বিরত করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক কন্টেন্ট দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিগত প্রভাব প্রকৃত ফুটেজে ছড়িয়ে পড়ে, এমনকি যখন দর্শকরা উৎস সম্পর্কে জানেন। প্ল্যাটফর্ম এবং কন্টেন্ট নির্মাতাদের জন্য, এটি মানুষ কীভাবে ভিজ্যুয়াল মিডিয়া অনুভব করে এবং বিশ্বাস করে তা রক্ষা করার জন্য সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলের প্রয়োজনীয়তা নির্দেশ করে।
কী লক্ষ্য রাখতে হবে: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সমাধান করতে হবে, শুধু জাল এবং বাস্তবকে আলাদা করার দিকে ফোকাস করা নয়। গবেষণাটি কম্পিউটিং সিস্টেমে মানব কারণ বিষয়ক ২০২৬ CHI সম্মেলনে উপস্থাপন করা হয়েছিল।
- 6
Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশনের সাথে
কী ঘটল: জার্মান এআই কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। মডেলটি প্রথমবারের মতো বিশ সেকেন্ড পর্যন্ত নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে, টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপের মধ্যে এজেন্ট-চালিত লিঙ্ক সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: দশ সেকেন্ডের ক্লিপে ৭২০পি-তে প্রাথমিক মূল্যায়ন ব্যবহার করে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর উপর পছন্দের দিক থেকে এগিয়ে ছিল — Luma Ray 3.2-এর ৯৩ শতাংশ, Runway Gen-4.5-এর ৭৭ শতাংশ এবং Grok Imagine Video-এর ৬৯ শতাংশ। শক্তিশালী প্রতিযোগীদের বিরুদ্ধে, এটি Seedance 2.0 এবং Gemini Omni Flash-এর সাথে মিলেছে বা কাছাকাছি ছিল (উভয়েই ৫২ শতাংশ পছন্দ), যারা ইতিমধ্যে বড় প্রোডাকশন ওয়ার্কফ্লো পরিচালনা করছে। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রোডাকশন কাজে পরীক্ষা করা হচ্ছে, যা আর্কিটেকচার রোবোটিক্স অ্যাপ্লিকেশনে সম্প্রসারিত হওয়ার পরামর্শ দেয়।
লক্ষ্য রাখার বিষয়: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসে চালু হতে চলেছে, জটিল প্রম্পট এবং বহুভাষিক পাঠ্য রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন প্রেডিকশন প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামে মাল্টিমোডাল ব্যাকবোনে ওপেন-ওয়েট অ্যাক্সেস দেওয়ার পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজের সাথে উপলব্ধি, অ্যাকশন এবং ভাষা পূর্বাভাস একত্রিত করে একটি একক মডেল তৈরিতে।
What to Watch
আগামী সপ্তাহগুলিতে Runway Characters-এর মতো রিয়েল-টাইম ভিডিও মডেল এবং FLUX 3-এর মাল্টিমোডাল ক্ষমতাগুলি কীভাবে বাস্তব জগতে কাজ করে তা দেখুন, বিশেষ করে যখন Midjourney সম্ভাব্যভাবে Discord-এর বাইরে যায় এবং BFL খোলা অ্যাক্সেস প্রদান করে। একই সাথে, মনোযোগ দিন যে গবেষকরা এআই-উৎপাদিত ভিডিওর মানসিক প্রভাব কীভাবে সম্বোধন করতে হবে তা নিয়ে কাজ করছেন—কারণ এই প্রযুক্তিগুলি আরও শক্তিশালী হওয়ার সাথে সাথে, শুধুমাত্র সত্য এবং মিথ্যা আলাদা করা যথেষ্ট নয়।
Sources
- Runway couldn't fix a bug in its AI video model, so it turned the bug into a feature
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free