Video Generation
Jul 27, 2026

The Gist
Black Forest Labs FLUX 3 নামক একটি নতুন মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করতে পারে এবং নেটিভ অডিও-ভিডিও জেনারেশন সমর্থন করে। একই সাথে, একটি গবেষণা দেখিয়েছে যে এআই দ্বারা তৈরি ভিডিও লেবেল করা সত্ত্বেও মানুষ বাস্তব ভিডিও বিশ্বাস করতে সংকোচ বোধ করছে। এই অগ্রগতি সত্ত্বেও, সৃজনশীল ব্যক্তিত্বরা এখনও LLM ব্যবহার করে সম্পূর্ণ দৈর্ঘ্যের চলচ্চিত্র তৈরিতে চ্যালেঞ্জ মুখোমুখি হচ্ছেন।
Today's Stories
- 1
আত্মকেন্দ্রিক ভিডিও প্রক্রিয়াকরণ প্ল্যাটফর্ম চালু হচ্ছে, ল্যাব অংশীদার খুঁজছে
কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা আত্মকেন্দ্রিক এবং স্থানিক ভিডিওর জন্য ডেটা প্রস্তুতি (ইটিএল) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (ভিএলএ) মডেল উন্নয়নের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে সেবা বিনামূল্যে পরীক্ষা করার জন্য খোলাভাবে নিয়োগ করছে। এটি কেন গুরুত্বপূর্ণ: ভৌত এআই এবং টেলিপারেশন সিস্টেম তৈরিকারী দলগুলি বর্তমানে ভিডিও ডেটা প্রাক-প্রক্রিয়াকরণে উল্লেখযোগ্য জিপিইউ সময় এবং প্রকৌশল প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা পাইপলাইনিং আপস্ট্রিমে পরিচালনা করে, এটি মূল মডেল কাজের জন্য কম্পিউটেশনাল সম্পদ এবং প্রকৌশল চক্র মুক্ত করে।
যা লক্ষ্য করতে হবে: অফারটি প্রতিক্রিয়া প্রদানে ইচ্ছুক ল্যাবগুলির মধ্যে সীমাবদ্ধ; আগ্রহী দলগুলিকে মন্তব্য করতে বা অংশগ্রহণ আলোচনা করার জন্য সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হচ্ছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক চালু হওয়ার সময়সূচী উল্লেখ করা হয়নি।
- 2
Midjourney অ্যাস্ট্রোলজি অ্যাপ Co-Star অধিগ্রহণ করেছে
কী ঘটেছে: ইমেজ এবং ভিডিও জেনারেটরের জন্য পরিচিত এআই ল্যাব Midjourney সোশ্যাল অ্যাস্ট্রোলজি অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star-এর প্রায় দুই ডজন কর্মচারীর দল Midjourney-তে যোগদান করেছে। কেন এটি গুরুত্বপূর্ণ: Co-Star-এর প্রতি মাসে প্রায় ৪৩ লক্ষ সক্রিয় ব্যবহারকারী রয়েছে এবং এটি হোরোস্কোপ ও জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরিতে এআই এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney-র মূল ইমেজ-জেনারেশন ব্যবসার বাইরে ভোক্তা-কেন্দ্রিক অ্যাপে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ তৈরির প্রচেষ্টার পরবর্তী ধাপ।
লক্ষ্য রাখতে হবে: Midjourney বর্তমানে প্রধানত Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দল ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা রাখে, যা ইঙ্গিত করে যে Midjourney অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে।
- 3
Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত
কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ইমেজ, ভিডিও, অডিও প্রজন্ম এবং অ্যাকশন পূর্বাভাস পরিচালনা করে। কোম্পানি FLUX-mimic ও উন্মোচন করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3-এর উপর নির্মিত এবং Audi-এর সাথে একটি একক অন-প্রিমাইসেস GPU-তে বাস্তব কারখানা স্থাপনার জন্য পরীক্ষা করা হয়েছে। এটি কেন গুরুত্বপূর্ণ: FLUX 3 অন্যান্য শীর্ষস্থানীয় ল্যাবগুলির দ্বারা আলাদাভাবে প্রদর্শিত সক্ষমতাগুলি পুনরুৎপাদন এবং প্রসারিত করে (Gemini Omni, Grok Imagine, Seedance 2.0), এবং দলটি একটি ওপেন-ওয়েট ডেভেলপার সংস্করণ খোলার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স প্রয়োগটি সংকেত দেয় যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে হস্তান্তর করা যায়, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভর ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল নির্মাণকারী ল্যাবগুলির জন্য বাধা কমায়।
লক্ষ্য রাখুন: FLUX 3 ভিডিও বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। মডেলের ইমেজ, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণকে একটি আর্কিটেকচারে একীভূত করার ক্ষমতা—যৌথভাবে প্রশিক্ষিত বনাম আলাদা মডিউল হিসাবে—এটি নির্ধারণ করবে মাল্টিমোডাল সিস্টেমগুলি শিল্পের মান হয়ে উঠবে নাকি কাজের দ্বারা বিভক্ত থাকবে।
- 4
এআই ভিডিও লেবেল করা সত্ত্বেও বাস্তব ভিডিওতে আস্থা কাঁপিয়ে দেয়, গবেষণায় দেখা গেছে
কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীদের নিয়ে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন, যেখানে এআই-উৎপাদিত ভিডিওর সংস্পর্শে আসা দল এবং মানব-উৎপাদিত ভিডিও দেখা নিয়ন্ত্রণ দলের তুলনা করা হয়েছে। এআই-সংস্পর্শ দল পরে নিয়ন্ত্রণ দলের সাথে মানব-উৎপাদিত বিষয়বস্তু দেখেছে এবং পরবর্তী ভিডিওর সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারে আস্থা হ্রাস, বৃহত্তর উপলব্ধিগত বিঘ্ন এবং কম সামাজিক সংযোগ রিপোর্ট করেছে—যদিও সিন্থেটিক বিষয়বস্তুটি এআই-উৎপাদিত ছিল তা স্পষ্টভাবে প্রকাশ করা হয়েছিল। এটি কেন গুরুত্বপূর্ণ: এই গবেষণা প্রকাশ করে যে কেবল এআই-উৎপাদিত ভিডিওতে লেবেল করা বাস্তব ভিডিওতে দর্শকদের আস্থা ভেঙে দেওয়া থেকে বিরত করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক বিষয়বস্তু দেখার মনস্তাত্ত্বিক এবং উপলব্ধিগত প্রভাব খাঁটি ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানেন। প্ল্যাটফর্ম এবং বিষয়বস্তু নির্মাতাদের জন্য, এটি নির্ধারণ এবং প্রকাশের বাইরে কৌশল প্রয়োজন নির্দেশ করে যা মানুষ কীভাবে দৃশ্যমান মিডিয়া অনুভব করে এবং বিশ্বাস করে তা রক্ষা করতে।
লক্ষ্য রাখার মতো বিষয়: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলিকে এআই-উৎপাদিত ভিডিও সংস্পর্শের অভিজ্ঞতামূলক এবং মনস্তাত্ত্বিক প্রভাবের সমাধান করতে হবে, শুধুমাত্র নকল থেকে বাস্তবকে আলাদা করার উপর ফোকাস করবে না। গবেষণাটি কম্পিউটিং সিস্টেমে মানব কারণ সম্পর্কে ২০২৬ CHI সম্মেলনে উপস্থাপিত হয়েছিল।
- 5
Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশন সহ
কী ঘটেছে: জার্মান AI কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। এই মডেল প্রথমবারের মতো বিশ সেকেন্ড পর্যন্ত দৈর্ঘ্যের নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত লিঙ্কগুলি সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: দশ সেকেন্ডের ক্লিপ এবং ৭২০পি রেজোলিউশনে প্রাথমিক মূল্যায়নে Flux 3 একাধিক প্রতিযোগীর উপর পছন্দ পেয়েছে: Luma Ray 3.2-এর চেয়ে ৯৩ শতাংশ, Runway Gen-4.5-এর চেয়ে ৭৭ শতাংশ এবং Grok Imagine Video-এর চেয়ে ৬৯ শতাংশ। শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash-এর সাথে সমান বা কাছাকাছি কর্মক্ষমতা দেখিয়েছে (প্রতিটি ৫২ শতাংশ পছন্দ), যারা ইতিমধ্যে প্রধান প্রোডাকশন ওয়ার্কফ্লো পরিবেশন করছে। BFL তাছাড়া Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রোডাকশন কাজে পরীক্ষা করা হচ্ছে, যা পরামর্শ দেয় যে এই আর্কিটেকচার রোবোটিক্স অ্যাপ্লিকেশনে প্রসারিত হতে পারে।
লক্ষ্য রাখুন: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে আর্লি অ্যাক্সেসে চালু হতে চলেছে, জটিল প্রম্পট এবং বহুভাষিক টেক্সট রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন প্রিডিকশন প্রাথমিকভাবে নির্বাচিত পার্টনারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নাম অনুযায়ী মাল্টিমোডাল ব্যাকবোনে ওপেন-ওয়েট অ্যাক্সেস পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ হিসেবে উপলব্ধি, অ্যাকশন এবং ভাষা প্রিডিকশন একত্রিত করে এমন একটি একক মডেল তৈরিতে।
- 6
সৃজনশীল ব্যক্তিত্ব LLM দিয়ে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করেছেন, এটিকে ব্যর্থতা বলে অভিহিত করেছেন
কী ঘটেছে: একজন সামগ্রী সৃষ্টিকারী Claude Fable 5 নামক একটি LLM ব্যবহার করে William Hope Hodgson-এর 'The House on the Borderland'-এর একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন এবং সংগীত ভিডিও ও AI-উত্পাদিত অ্যালবামগুলির সাথে তাদের YouTube চ্যানেলে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষা পরীক্ষা করে যে বড় ভাষা মডেলগুলি মানব হস্তক্ষেপ ছাড়াই একটি সম্পূর্ণ দৈর্ঘ্যের প্রকল্প জুড়ে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এমন একটি প্রশ্ন যা বর্তমান AI সক্ষমতার বাইরে কী ধরনের সৃজনশীল কাজ রয়ে গেছে তা নির্দেশ করে, এমনকি যখন তাদের স্বাধীনভাবে কাজ করার সময় এবং অনুমতি দেওয়া হয়।
লক্ষ্য রাখুন: সৃষ্টিকারী এটি প্রকাশ করা সত্ত্বেও ফলাফলটিকে একটি ব্যর্থতা হিসাবে উপস্থাপন করেছেন, উল্লেখ করে যে তারা এটি শুধুমাত্র YouTube চ্যানেল মান অনুযায়ী বিচার করেছেন বরং সম্পূর্ণ বিভাগ হিসাবে চলচ্চিত্রের চেয়ে; তারা এই ঘাটতি LLM-এর এজেন্সি বা পরিকল্পনার জন্য নয়, বরং অন্যান্য কারণের জন্য দায়ী করেন যা তারা সম্পূর্ণ নিবন্ধে আলোচনা করেন।
What to Watch
আগামী সপ্তাহগুলিতে Flux 3 Image এবং Flux 3 Video-এর প্রাথমিক অ্যাক্সেস সম্প্রসারণ দেখুন, যেখানে মাল্টিমোডাল ক্ষমতা এবং ডিজাইন নীতিগুলি কীভাবে AI-উৎপাদিত সামগ্রীর প্রভাব নির্ধারণ করে তা পর্যবেক্ষণ করুন। একই সাথে, Midjourney-এর সম্ভাব্য স্বতন্ত্র অ্যাপ্লিকেশন এবং BFL-এর দীর্ঘমেয়াদী মাল্টিমোডাল মডেল উন্নয়নের দিকে নজর রাখুন, যা ভিডিও প্রজন্মের শিল্পে পরবর্তী বড় পরিবর্তন আনতে পারে।
Sources
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free