Video Generation
Jul 25, 2026

The Gist
ভিডিও জেনারেশন প্রযুক্তিতে বড় অগ্রগতি হচ্ছে - Black Forest Labs তাদের নতুন FLUX 3 মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করে, এবং Midjourney জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে সৃজনশীল সরঞ্জাম সম্প্রসারণের জন্য। তবে গবেষণা দেখাচ্ছে যে AI-উৎপাদিত ভিডিও লেবেল করা সত্ত্বেও মানুষের আসল ভিডিওতে বিশ্বাস কমিয়ে দেয়, যা এই প্রযুক্তির নৈতিক চ্যালেঞ্জ তুলে ধরে।
Today's Stories
- 1
ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু হচ্ছে, ল্যাব পার্টনার খুঁজছে
কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা ইগোসেন্ট্রিক এবং স্পেশাল ভিডিওর জন্য ডেটা প্রস্তুতি (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য খোলাভাবে নিয়োগ দিচ্ছে। কেন এটি গুরুত্বপূর্ণ: ফিজিক্যাল AI এবং টেলিঅপারেশন সিস্টেম নির্মাণকারী দলগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং প্রকৌশল প্রচেষ্টা ব্যয় করে—যা এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা প্লাম্বিং আপস্ট্রিমে পরিচালনা করে, এটি গণনামূলক সংস্থান এবং মূল মডেল কাজের জন্য প্রকৌশল চক্রকে মুক্ত করে।
কী নজর রাখতে হবে: অফারটি প্রতিক্রিয়া প্রদানে ইচ্ছুক ল্যাবগুলির জন্য সীমাবদ্ধ; আগ্রহী দলগুলিকে অংশগ্রহণ নিয়ে আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক লঞ্চ সময়সূচী বলা হয়নি।
- 2
Midjourney অধিগ্রহণ করেছে জ্যোতিষ অ্যাপ Co-Star
কী ঘটেছে: Midjourney, যা ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত একটি এআই ল্যাব, সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাদি প্রকাশ করা হয়নি। Co-Star-এর প্রায় দুই ডজন কর্মচারী Midjourney-তে যোগ দিয়েছেন। এটি কেন গুরুত্বপূর্ণ: Co-Star-এর প্রায় ৪৩ লক্ষ মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি কৃত্রিম বুদ্ধিমত্তা এবং মানব লেখার সমন্বয়ে রাশিফল ও জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করে। এই অধিগ্রহণ Midjourney-এর মূল ছবি-প্রজন্ম ব্যবসার বাইরে ভোক্তা-কেন্দ্রিক অ্যাপে সম্প্রসারণের ইঙ্গিত দেয় এবং এটি চিকিৎসা ও স্পা বিভাগ তৈরির প্রচেষ্টার পরবর্তী অংশ।
যা পর্যবেক্ষণ করতে হবে: Midjourney বর্তমানে প্রাথমিকভাবে Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দল ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা Midjourney-কে অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে এই ইঙ্গিত দেয়।
- 3
Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত
কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও জেনারেশন এবং অ্যাকশন প্রেডিকশন পরিচালনা করে। কোম্পানিটি FLUX-mimic ও উন্মোচন করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3 এর ভিত্তিতে তৈরি এবং Audi এর সাথে একটি একক অন-প্রিমাইসেস GPU তে বাস্তব ফ্যাক্টরি স্থাপনার জন্য পরীক্ষিত। এটি কেন গুরুত্বপূর্ণ: FLUX 3 অন্যান্য অগ্রণী ল্যাবগুলির দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতাগুলি পুনরুৎপাদন এবং সম্প্রসারিত করে (Gemini Omni, Grok Imagine, Seedance 2.0), দলটি একটি ওপেন-ওয়েটস ডেভেলপার সংস্করণ খোলার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স প্রয়োগটি সংকেত দেয় যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরিকারী ল্যাবগুলির জন্য বাধা কমাতে পারে।
যা দেখতে হবে: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। একটি আর্কিটেকচারে ছবি, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণ একীভূত করার এই মডেলের ক্ষমতা—আলাদা মডিউল হিসাবে নয় বরং যৌথভাবে প্রশিক্ষিত—মাল্টিমোডাল সিস্টেম শিল্পের মান হয়ে উঠবে নাকি কাজ দ্বারা খণ্ডিত থাকবে তা নির্ধারণ করবে।
- 4
AI দ্বারা তৈরি ভিডিও লেবেল করা সত্ত্বেও প্রকৃত ভিডিওর প্রতি বিশ্বাস নষ্ট করে, গবেষণায় দেখা গেছে
কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীদের সাথে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন, যেখানে AI-উত্পন্ন ভিডিওর সংস্পর্শে আসা গ্রুপকে মানব-উত্পাদিত ভিডিও দেখা নিয়ন্ত্রণ গ্রুপের সাথে তুলনা করা হয়েছিল। AI-সংস্পর্শ গ্রুপ তারপর মানব-উত্পাদিত সামগ্রী দেখেছিল এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের판断ের প্রতি হ্রাসপ্রাপ্ত আস্থা, বৃহত্তর উপলব্ধিগত ব্যাঘাত এবং নিম্ন সামাজিক সংযোগ রিপোর্ট করেছিল—যদিও সিন্থেটিক সামগ্রী AI-উত্পন্ন ছিল তার স্পষ্ট প্রকাশ সত্ত্বেও। কেন এটি গুরুত্বপূর্ণ: এই সন্ধানগুলি প্রকাশ করে যে AI-উত্পাদিত ভিডিওগুলিকে সহজভাবে লেবেল করা প্রকৃত ভিডিওগুলিতে দর্শকদের বিশ্বাস নষ্ট করা থেকে রোধ করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক সামগ্রী দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিগত প্রভাবগুলি খাঁটি ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানেন। প্ল্যাটফর্ম এবং সামগ্রী সৃষ্টিকারীদের জন্য, এটি নকল থেকে প্রকৃত পার্থক্য করার জন্য মানুষ দৃশ্যমান মিডিয়া কীভাবে অভিজ্ঞতা এবং বিশ্বাস করে তা রক্ষা করতে সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলগুলির প্রয়োজন নির্দেশ করে।
পর্যবেক্ষণীয়: এই গবেষণাটি হাইলাইট করে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই AI-উত্পাদিত ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সম্বোধন করতে হবে, শুধুমাত্র জাল থেকে বাস্তব আলাদা করার উপর দৃষ্টি নিবদ্ধ করতে হবে না। এই গবেষণাটি ২০২৬ CHI Conference on Human Factors in Computing Systems এ উপস্থাপন করা হয়েছিল।
- 5
Black Forest Labs Flux 3 প্রকাশ করল স্থানীয় অডিও ভিডিও উৎপাদন বৈশিষ্ট্য সহ
কী ঘটল: জার্মান কৃত্রিম বুদ্ধিমত্তা কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি বহুমাত্রিক ভিত্তি মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। মডেলটি প্রথমবারের মতো পঞ্চাশ সেকেন্ড পর্যন্ত স্থানীয় অডিও সহ ভিডিও তৈরি করতে পারে, যা পাঠ্য-থেকে-ভিডিও, ছবি-থেকে-ভিডিও, ভিডিও-থেকে-ভিডিও, কীফ্রেম-ভিত্তিক রূপান্তর, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত সংযোগ সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: দশ সেকেন্ডের ক্লিপে সাতশ বিশ পিক্সেল রেজোলিউশনে প্রাথমিক মূল্যায়নে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর উপর পছন্দ করা হয়েছে: Luma Ray 3.2 এর উপর তিরানব্বই প্রতিশত, Runway Gen-4.5 এর উপর সাতাত্তর প্রতিশত এবং Grok Imagine Video এর উপর উনসত্তর প্রতিশত। শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash এর সমান ছিল অথবা কাছাকাছি ছিল (প্রতিটি বায়ান্ন প্রতিশত পছন্দে), যারা ইতিমধ্যে বড় উৎপাদন কর্মপ্রবাহ পরিবেশন করে। BFL এছাড়াও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi এ উৎপাদন কাজে পরীক্ষা করা হচ্ছে, যা পরামর্শ দেয় যে স্থাপত্য রোবোটিক্স প্রয়োগে বিস্তৃত।
যা লক্ষ্য করতে হবে: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসের জন্য চালু হতে চলেছে, জটিল অনুরোধ এবং বহুভাষিক পাঠ্য রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন ভবিষ্যদ্বাণী প্রথমে নির্বাচিত অংশীদারদের মাধ্যমে প্রদান করা হবে। BFL 'Flux 3 Dev' নামের অধীনে বহুমাত্রিক মেরুদণ্ডে খোলা-ওজন অ্যাক্সেস পরিকল্পনা করছে, উপলব্ধি, অ্যাকশন এবং ভাষা ভবিষ্যদ্বাণী একত্রিত করে এমন একক মডেলের দীর্ঘমেয়াদী কাজ সহ।
- 6
সৃজনশীল নির্মাতা LLM ব্যবহার করে দীর্ঘমেয়াদী চলচ্চিত্র তৈরি করেন, এটিকে ব্যর্থ বলে অভিহিত করেন
কী ঘটেছে: একজন সামগ্রী সৃষ্টিকারী Claude Fable 5 নামের একটি LLM ব্যবহার করে উইলিয়াম হোপ হডজসনের 'দ্য হাউস অন দ্য বর্ডারল্যান্ড'-এর একটি দীর্ঘমেয়াদী চলচ্চিত্র অভিযোজন তৈরি করেছেন এবং তা তাদের YouTube চ্যানেলে সংগীত ভিডিও এবং AI-উৎপাদিত অ্যালবামের পাশাপাশি আপলোড করেছেন। এটি গুরুত্বপূর্ণ কেন: এই পরীক্ষা-নিরীক্ষা পরীক্ষা করে যে বড় ভাষা মডেলগুলি মানুষের হস্তক্ষেপ ছাড়াই একটি সম্পূর্ণ দীর্ঘমেয়াদী প্রকল্প জুড়ে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এটি এমন একটি প্রশ্ন যা বর্তমান AI ক্ষমতার বাইরে কোন ধরনের সৃজনশীল কাজ থাকে তার উপর প্রভাব ফেলে।
লক্ষ্য রাখুন: নির্মাতা এটি প্রকাশ করার পরেও ফলাফলকে ব্যর্থতা হিসেবে উপস্থাপন করেছেন এবং উল্লেখ করেছেন যে তারা এটি শুধুমাত্র YouTube চ্যানেল মান অনুযায়ী বিচার করেছেন, সম্পূর্ণ চলচ্চিত্র বিভাগ হিসেবে নয়; তারা এই ত্রুটিটিকে LLM-এর এজেন্সি বা পরিকল্পনার কাছে নয়, বরং অন্যান্য কারণের কাছে দায়ী করেছেন যা তারা তাদের সম্পূর্ণ নিবন্ধে আলোচনা করেছেন।
What to Watch
আগামী সপ্তাহগুলিতে Flux 3 Image-এর প্রাথমিক অ্যাক্সেস চালু এবং BFL-এর বহুমাত্রিক মডেল উন্নয়ন লক্ষ্য রাখুন, যা ভিডিও, ইমেজ এবং অডিও একসাথে পরিচালনার ক্ষমতা নিয়ে আসবে। একই সাথে, Midjourney-এর নিজস্ব অ্যাপ্লিকেশন তৈরি এবং AI-উত্পাদিত কন্টেন্টের মনোবৈজ্ঞানিক প্রভাব নিয়ে গবেষণার এগিয়ে যাওয়া নজরে রাখুন, কারণ এগুলি ভিডিও প্রযুক্তির ভবিষ্যৎ গঠন করবে।
Sources
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free