Video Generation
Jul 26, 2026

The Gist
Black Forest Labs তাদের নতুন FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করে, যা এআই-চালিত সৃজনশীল সরঞ্জামের জগতে একটি বড় পদক্ষেপ। তবে গবেষণা দেখায় যে এআই-উৎপাদিত ভিডিও লেবেল থাকা সত্ত্বেও মানুষ বাস্তব ভিডিওতে আস্থা হারাতে পারে, যা প্রযুক্তির নৈতিক প্রভাব সম্পর্কে প্রশ্ন তোলে। এই সময়ে, সৃজনশীল শিল্পীরা এলএলএম ব্যবহার করে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরির প্রচেষ্টা শুরু করেছেন, যদিও প্রাথমিক ফলাফল মিশ্র হয়েছে।
Today's Stories
- 1
ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু, ল্যাব পার্টনার খুঁজছে
কী ঘটেছে: একটি স্টার্টআপ ইগোসেন্ট্রিক এবং স্পেশিয়াল ভিডিওর জন্য ডেটা প্রিপারেশন (ETL) পাইপলাইন স্বয়ংক্রিয় করে এমন একটি প্ল্যাটফর্ম তৈরি করেছে, যা রোবটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য কাঁচা ফুটেজকে মডেল-রেডি আউটপুটে রূপান্তরিত করে। দলটি গবেষণা ল্যাব এবং কোম্পানিগুলিকে সেবা বিনামূল্যে পরীক্ষা করার জন্য প্রকাশ্যে নিয়োগ দিচ্ছে। কেন এটি গুরুত্বপূর্ণ: ফিজিক্যাল AI এবং টেলিঅপারেশন সিস্টেম তৈরিকারী দলগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং ইঞ্জিনিয়ারিং প্রচেষ্টা ব্যয় করে—এই বটলনেক দূর করতে প্ল্যাটফর্মটি ডিজাইন করা হয়েছে। ডেটা পাইপলাইনিং আপস্ট্রিমে পরিচালনা করে, এটি মূল মডেল কাজের জন্য কম্পিউটেশনাল রিসোর্স এবং ইঞ্জিনিয়ারিং চক্র মুক্ত করে।
যা দেখার মতো: এই প্রস্তাবটি ফিডব্যাক প্রদানে ইচ্ছুক ল্যাবের জন্য সীমাবদ্ধ; আগ্রহী দলগুলিকে অংশগ্রহণ আলোচনার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনও মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক লঞ্চ সময়রেখা উল্লেখ করা হয়নি।
- 2
Midjourney অ্যাস্ট্রোলজি অ্যাপ Co-Star অধিগ্রহণ করেছে
কী ঘটেছে: ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত AI ল্যাব Midjourney সোশ্যাল অ্যাস্ট্রোলজি অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star এর প্রায় দুই ডজন কর্মচারীর দল Midjourney-তে যোগদান করেছে। এটি কেন গুরুত্বপূর্ণ: Co-Star এর প্রায় ৪৩ লক্ষ মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি হরোস্কোপ এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে AI এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney এর মূল ছবি-প্রজন্ম ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ তৈরির প্রচেষ্টার পরে আসে।
যা লক্ষ্য করতে হবে: Midjourney বর্তমানে প্রাথমিকভাবে Discord এর মাধ্যমে পরিচালিত হয় এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star এর দল ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা Midjourney কে অবশেষে তার নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে এমন ইঙ্গিত দেয়।
- 3
Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত
কী ঘটল: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং চিত্র, ভিডিও, অডিও উৎপাদন এবং কর্ম পূর্বাভাস পরিচালনা করে। কোম্পানি FLUX-mimic ও উন্মোচন করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3 এর উপর নির্মিত এবং Audi এর সাথে একটি একক অন-প্রিমাইসেস GPU-তে বাস্তব কারখানা স্থাপনার জন্য পরীক্ষা করা হয়েছে। কেন এটি গুরুত্বপূর্ণ: FLUX 3 অন্যান্য অগ্রবর্তী ল্যাবগুলির দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতা পুনরুৎপাদন এবং সম্প্রসারিত করে (Gemini Omni, Grok Imagine, Suno 2.0), দলটি একটি ওপেন-ওয়েট ডেভেলপার সংস্করণ চালু করার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স অ্যাপ্লিকেশন নির্দেশ করে যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরি করা ল্যাবগুলির জন্য বাধা কমাতে পারে।
যা দেখতে হবে: FLUX 3 ভিডিও বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। চিত্র, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণকে একটি আর্কিটেকচারে একীভূত করার মডেলের ক্ষমতা—যা পৃথক মডিউল হিসাবে নয় বরং যৌথভাবে প্রশিক্ষিত—এটি নির্ধারণ করবে মাল্টিমোডাল সিস্টেমগুলি শিল্প মানদণ্ড হয়ে ওঠে না কাজ দ্বারা বিভক্ত থাকে।
- 4
এআই ভিডিও লেবেল করা সত্ত্বেও বাস্তব ভিডিওতে আস্থা নষ্ট করে, গবেষণা প্রমাণ করে
কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারী নিয়ে দুই পর্যায়ের গবেষণা পরিচালনা করেছেন যেখানে এআই-উৎপাদিত ভিডিও দেখা গোষ্ঠীর সাথে মানব-উৎপাদিত ভিডিও দেখা নিয়ন্ত্রণ গোষ্ঠীর তুলনা করা হয়েছে। এআই-এক্সপোজার গ্রুপ তারপর মানব-উৎপাদিত বিষয়বস্তু দেখেছে নিয়ন্ত্রণ গোষ্ঠীর সাথে একসাথে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারে হ্রাসকৃত আস্থা, বৃহত্তর উপলব্ধি ব্যাঘাত এবং কম সামাজিক সংযোগ রিপোর্ট করেছে—সিন্থেটিক বিষয়বস্তু এআই-উৎপাদিত ছিল এই বিষয়ে স্পষ্ট প্রকাশ থাকা সত্ত্বেও। কেন এটি গুরুত্বপূর্ণ: গবেষণার ফলাফল প্রকাশ করে যে এআই-উৎপাদিত ভিডিওগুলিতে সহজ লেবেল করা বাস্তব ভিডিওতে দর্শকদের আস্থা নষ্ট করতে প্রতিরোধ করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক বিষয়বস্তু দেখার মনস্তাত্ত্বিক এবং উপলব্ধি প্রভাব প্রকৃত ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানে। প্ল্যাটফর্ম এবং বিষয়বস্তু নির্মাতাদের জন্য, এটি নির্দেশ করে যে লোকেরা কীভাবে ভিজ্যুয়াল মিডিয়া অনুভব করে এবং বিশ্বাস করে তা রক্ষা করার জন্য সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলের প্রয়োজন।
লক্ষ্য রাখতে হবে: গবেষণা হাইলাইট করে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই এআই-উৎপাদিত ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনস্তাত্ত্বিক প্রভাবগুলি সমাধান করতে হবে, শুধুমাত্র নকল থেকে বাস্তব আলাদা করার উপর ফোকাস করতে হবে না। গবেষণাটি দুই হাজার ছাব্বিশ সালের কম্পিউটিং সিস্টেমে মানব কারণগুলির উপর CHI সম্মেলনে উপস্থাপন করা হয়েছিল।
- 5
Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশন ক্ষমতা সহ
কী ঘটেছে: জার্মান AI কোম্পানি Black Forest Labs তার Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। এই মডেল প্রথমবারের মতো ২০ সেকেন্ড পর্যন্ত নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ ও এজেন্ট-চালিত ক্লিপ লিঙ্কেজ সমর্থন করে। গুরুত্ব কেন: দশ সেকেন্ডের ক্লিপ এবং ৭২০পি রেজোলিউশনে প্রাথমিক মূল্যায়নে Flux 3 প্রতিদ্বন্দ্বীদের উপর পছন্দে এগিয়ে ছিল — Luma Ray 3.2 এর চেয়ে ৯৩ শতাংশ, Runway Gen-4.5 এর চেয়ে ৭৭ শতাংশ এবং Grok Imagine Video এর চেয়ে ৬৯ শতাংশ। আরও শক্তিশালী প্রতিযোগীদের বিপরীতে এটি Seedance 2.0 এবং Gemini Omni Flash (প্রতিটিতে ৫২ শতাংশ পছন্দ) এর সাথে সমান বা কাছাকাছি ছিল, যা ইতিমধ্যে প্রধান প্রযোজনা কর্মপ্রবাহে ব্যবহৃত হয়। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রযোজনা কাজে পরীক্ষা করা হচ্ছে, যা আর্কিটেকচার রোবোটিক্স অ্যাপ্লিকেশনে সম্প্রসারিত হওয়ার ইঙ্গিত দেয়।
দেখার বিষয়: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসের জন্য চালু হবে, জটিল প্রম্পট এবং বহুভাষিক টেক্সট রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন প্রেডিকশন প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামে মাল্টিমোডাল ব্যাকবোন অ্যাক্সেসের জন্য খোলা-ওজন পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ সহ উপলব্ধি, কর্ম এবং ভাষা পূর্বাভাসকে একীভূত করে এমন একটি একক মডেলে।
- 6
সৃজনশীল শিল্পী LLM ব্যবহার করে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করলেন, একে ব্যর্থতা বলে অভিহিত করেছেন
কী ঘটেছে: একজন সামগ্রী নির্মাতা Claude Fable 5 নামক একটি বৃহৎ ভাষা মডেল ব্যবহার করে উইলিয়াম হোপ হডসনের 'দ্য হাউস অন দ্য বর্ডারল্যান্ড' উপন্যাসের একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন এবং এটি তাদের ইউটিউব চ্যানেলে সঙ্গীত ভিডিও এবং AI-উৎপন্ন অ্যালবামের সাথে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষা-নিরীক্ষা পরীক্ষা করে যে মানব হস্তক্ষেপ ছাড়াই বৃহৎ ভাষা মডেলগুলি একটি সম্পূর্ণ দৈর্ঘ্যের প্রকল্প জুড়ে সৃজনশীল আউটপুট টিকিয়ে রাখতে পারে কিনা—এটি একটি প্রশ্ন যা বর্তমান AI সামর্থ্যের বাইরে কোন ধরনের সৃজনশীল কাজ থেকে যায়, এমনকি যখন স্বাধীনভাবে কাজ করার জন্য সময় এবং অনুমতি দেওয়া হয়।
পর্যবেক্ষণের বিষয়: নির্মাতা এটি প্রকাশ করা সত্ত্বেও ফলাফলকে একটি ব্যর্থতা হিসাবে উপস্থাপন করেছেন, উল্লেখ করে যে তারা এটিকে সম্পূর্ণ ফিল্ম ক্যাটাগরির পরিবর্তে শুধুমাত্র ইউটিউব চ্যানেল মানদণ্ড অনুযায়ী বিচার করেছেন; তারা এই ত্রুটিটি LLM-এর দক্ষতা বা পরিকল্পনার জন্য নয় বরং অন্যান্য কারণের জন্য দায়ী করেন যা তারা সম্পূর্ণ নিবন্ধে আলোচনা করেন।
What to Watch
আগামী সপ্তাহগুলিতে Flux 3 Image এর প্রাথমিক অ্যাক্সেস এবং BFL এর মাল্টিমোডাল ব্যাকবোন 'Flux 3 Dev' এর ওপেন-ওজন পরিকল্পনা লক্ষ্য রাখার মতো, যা ভিডিও, ইমেজ, অডিও এবং রোবোটিক্সকে একটি একক সমন্বিত মডেলে একীভূত করবে। একই সাথে, এআই-উৎপাদিত ভিডিওর ডিজাইন এবং নীতিগত দিকগুলি কীভাবে বিকশিত হয় তা পর্যবেক্ষণ করুন, কারণ শিল্পটি শুধুমাত্র খাঁটিতা যাচাইয়ের বাইরে এর মনস্তাত্ত্বিক এবং অভিজ্ঞতামূলক প্রভাবগুলি সম্বোধন করার দিকে মনোনিবেশ করছে।
Sources
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free