Video Generation
Jul 24, 2026

The Gist
ভিডিও জেনারেশন প্রযুক্তিতে আজ বড় অগ্রগতি হয়েছে - Black Forest Labs তাদের নতুন FLUX 3 মডেল লঞ্চ করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করে এবং নেটিভ অডিও-ভিডিও জেনারেশন সক্ষম করে। একই সাথে, একটি নতুন গবেষণায় দেখা গেছে যে AI দিয়ে লেবেল করা ভিডিওগুলি মানুষের বাস্তব ভিডিওর প্রতি আস্থা কমিয়ে দেয়, যা এই প্রযুক্তির সামাজিক প্রভাব নিয়ে প্রশ্ন তোলে।
Today's Stories
- 1
ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু হল, ল্যাব পার্টনার খুঁজছে
কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা ইগোসেন্ট্রিক এবং স্প্যাশিয়াল ভিডিওর জন্য ডেটা প্রস্তুতি (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য খোলাভাবে নিয়োগ দিচ্ছে। এটি কেন গুরুত্বপূর্ণ: শারীরিক কৃত্রিম বুদ্ধিমত্তা এবং টেলিঅপারেশন সিস্টেম তৈরি করছে এমন দলগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং ইঞ্জিনিয়ারিং প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্ম দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা প্লাম্বিং আপস্ট্রিমে পরিচালনা করে, এটি কম্পিউটেশনাল সংস্থান এবং ইঞ্জিনিয়ারিং চক্র মূল মডেল কাজের জন্য মুক্ত করে।
যা লক্ষ্য রাখতে হবে: অফারটি প্রতিক্রিয়া প্রদানে ইচ্ছুক ল্যাবগুলির জন্য সীমাবদ্ধ; আগ্রহী দলগুলিকে অংশগ্রহণ আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক চালু করার সময়সূচী উল্লেখ করা হয়নি।
- 2
Midjourney অধিগ্রহণ করেছে Co-Star জ্যোতিষ অ্যাপ
কী ঘটেছে: Midjourney, একটি AI ল্যাব যা ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত, সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star-এর প্রায় চব্বিশ জন কর্মচারীর দল Midjourney-তে যোগদান করেছেন। কেন এটি গুরুত্বপূর্ণ: Co-Star-এর প্রতি মাসে প্রায় চল্লিশ লক্ষ সক্রিয় ব্যবহারকারী রয়েছে এবং এটি রাশিফল এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে AI এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney-র মূল ছবি-জেনারেশন ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ গড়ার প্রচেষ্টার পরে আসে।
লক্ষ রাখতে হবে: Midjourney বর্তমানে প্রধানত Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দলের ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা পরামর্শ দেয় যে Midjourney অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে।
- 3
Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত
কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও তৈরি এবং অ্যাকশন প্রেডিকশন সামলায়। কোম্পানি FLUX-mimic ও অনাবৃত করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3-এর উপর নির্মিত এবং একটি একক অন-প্রিমাইসেস GPU-তে বাস্তব ফ্যাক্টরি স্থাপনার জন্য Audi-এর সাথে পরীক্ষা করা হয়েছে। এর গুরুত্ব কেন: FLUX 3 অন্যান্য অগ্রগামী ল্যাব দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতা প্রজনন এবং প্রসারিত করে (Gemini Omni, Grok Imagine, Seedance 2.0), দলটি একটি খোলা-ওয়েট ডেভেলপার সংস্করণ চালু করার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স অ্যাপ্লিকেশনটি ইঙ্গিত করে যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক খোলা মডেল তৈরি করে এমন ল্যাবগুলির জন্য বাধা হ্রাস করে।
নজর রাখার বিষয়: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। একটি একক আর্কিটেকচারে ছবি, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণকে একীভূত করার মডেলের ক্ষমতা—যৌথভাবে প্রশিক্ষিত বরং পৃথক মডিউল হিসাবে নয়—মাল্টিমোডাল সিস্টেমগুলি শিল্পের মান হয়ে ওঠে নাকি টাস্কের দ্বারা খণ্ডিত থাকে তা নির্ধারণ করবে।
- 4
AI ভিডিও লেবেল করা থাকলেও বাস্তব ভিডিওর প্রতি আস্থা কমায়, গবেষণায় দেখা গেছে
কী ঘটেছে: গবেষণকরা একশত জন অংশগ্রহণকারী নিয়ে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন, যেখানে AI-উৎপন্ন ভিডিও দেখা গ্রুপের সাথে মানুষের তৈরি ভিডিও দেখা নিয়ন্ত্রণ গ্রুপের তুলনা করা হয়েছে। AI-সম্পর্কিত গ্রুপ তারপর নিয়ন্ত্রণ গ্রুপের সাথে মানুষের তৈরি কন্টেন্ট দেখেছে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারের প্রতি আস্থা হ্রাস, উচ্চতর উপলব্ধিমূলক ব্যাঘাত এবং কম সামাজিক সংযোগ রিপোর্ট করেছে—যদিও সিন্থেটিক কন্টেন্ট AI-উৎপন্ন তা স্পষ্টভাবে প্রকাশ করা হয়েছিল। কেন এটি গুরুত্বপূর্ণ: গবেষণার ফলাফল প্রকাশ করে যে AI-উৎপন্ন ভিডিওগুলিতে সহজ লেবেল লাগানো বাস্তব ভিডিওগুলির প্রতি দর্শকদের আস্থা কমানো থেকে রোধ করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত কৃত্রিম কন্টেন্ট দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিমূলক প্রভাব প্রকৃত ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানেন। প্ল্যাটফর্ম এবং কন্টেন্ট নির্মাতাদের জন্য, এটি নির্দেশ করে যে লোকেরা দৃশ্যমান মিডিয়া অভিজ্ঞতা এবং বিশ্বাস করে তা রক্ষা করার জন্য সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলগুলির প্রয়োজন।
কী লক্ষ্য রাখতে হবে: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলি AI-উৎপন্ন ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সমাধান করতে হবে, শুধুমাত্র জাল থেকে বাস্তবকে আলাদা করার উপর ফোকাস করা নয়। গবেষণাটি 2026 সালের CHI Conference on Human Factors in Computing Systems-এ উপস্থাপন করা হয়েছিল।
- 5
Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশন সহ
কী ঘটেছে: জার্মান এআই কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ইমেজ, ভিডিও এবং অডিও একসাথে শিখে। এই মডেলটি প্রথমবারের মতো নেটিভ অডিওসহ বিশ সেকেন্ড পর্যন্ত দীর্ঘ ভিডিও জেনারেট করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত লিঙ্ক সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: প্রাথমিক মূল্যায়নে দশ সেকেন্ডের ক্লিপ ব্যবহার করে ৭২০পি রেজোলিউশনে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর চেয়ে পছন্দসই ছিল: Luma Ray 3.2 এর চেয়ে ৯৩ শতাংশ, Runway Gen-4.5 এর চেয়ে ৭৭ শতাংশ, এবং Grok Imagine Video এর চেয়ে ৬৯ শতাংশ। শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash এর সাথে সমান অথবা কাছাকাছি ছিল (প্রতিটি ৫২ শতাংশ পছন্দ), যারা ইতিমধ্যে প্রধান প্রোডাকশন ওয়ার্কফ্লো সেবা করে। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রোডাকশন কাজে পরীক্ষা করা হচ্ছে, যা স্থাপত্য রোবোটিক্স অ্যাপ্লিকেশনে প্রসারিত হয় এমন পরামর্শ দেয়।
কী দেখতে হবে: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে আর্লি অ্যাক্সেসে চালু করার জন্য নির্ধারিত, যা জটিল প্রম্পট এবং বহুভাষিক পাঠ রেন্ডারিং উন্নত করে। অ্যাকশন প্রিডিকশন প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামের অধীন মাল্টিমোডাল ব্যাকবোন অ্যাক্সেস খোলার পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ একটি একক মডেল একত্রিত করে পারসেপশন, অ্যাকশন এবং ভাষা পূর্বাভাস সহ।
- 6
সৃজনশীল নির্মাতা LLM ব্যবহার করে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করলেন, এটিকে ব্যর্থতা বলে অভিহিত করলেন
কী ঘটেছে: একজন কন্টেন্ট ক্রিয়েটর Claude Fable 5 ব্যবহার করে William Hope Hodgson-এর The House on the Borderland উপন্যাসের একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন, যা তিনি তাদের YouTube চ্যানেলে সংগীত ভিডিও এবং AI-উৎপাদিত অ্যালবামের সাথে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষাটি পরীক্ষা করে যে বড় ভাষা মডেলগুলি মানব হস্তক্ষেপ ছাড়াই একটি সম্পূর্ণ-দৈর্ঘ্য প্রকল্পে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এটি এমন একটি প্রশ্ন যা নির্দেশ করে কোন ধরনের সৃজনশীল কাজ বর্তমান AI ক্ষমতার বাইরে থাকে, এমনকি স্বাধীনভাবে কাজ করার সময় এবং অনুমতি দেওয়া হলেও।
যা লক্ষ্য করতে হবে: সৃজনশীলকর্মী এটি প্রকাশ করা সত্ত্বেও ফলাফলটিকে একটি ব্যর্থতা হিসাবে উপস্থাপন করেন, উল্লেখ করে যে তারা এটিকে সমগ্র চলচ্চিত্র বিভাগের পরিবর্তে শুধুমাত্র YouTube চ্যানেল মানদণ্ড অনুসারে মূল্যায়ন করেছেন; তারা এই ত্রুটিটি LLM-এর দায়িত্ব বা পরিকল্পনার জন্য নয়, বরং অন্যান্য কারণের জন্য দায়ী করেন যা তারা সম্পূর্ণ নিবন্ধে আলোচনা করেছেন।
What to Watch
আগামী দিনগুলিতে নজর রাখুন Midjourney-র সম্ভাব্য স্বতন্ত্র অ্যাপ্লিকেশন লঞ্চ এবং Flux 3 Image ও Action Prediction টুলের প্রাথমিক অ্যাক্সেস চালুর জন্য, যা AI-উৎপন্ন ভিডিও এবং ইমেজ প্রযুক্তির ক্ষেত্রে একটি নতুন যুগের সূচনা করবে। একই সাথে, AI সিস্টেমগুলিকে কীভাবে ডিজাইন ও নীতি তৈরি করা হয় তার মাধ্যমে ব্যবহারকারীদের মানসিক এবং অভিজ্ঞতামূলক প্রভাবের উপর কী প্রভাব ফেলে তা বোঝা কতটা গুরুত্বপূর্ণ তা নিয়ে গবেষণার ফলাফলগুলি শিল্পের মানদণ্ড তৈরি করবে।
Sources
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free