Video Generation
Jul 23, 2026

The Gist
Black Forest Labs তাদের নতুন Flux 3 মডেল প্রকাশ করেছে যা নেটিভ অডিও এবং ভিডিও জেনারেশন ক্ষমতা সহ ছবি, ভিডিও এবং অডিও সবকিছু তৈরি করতে পারে। একই সাথে Runway মিডিয়া রাউটার এবং Synthesia এআই ভিডিও তৈরির সরঞ্জাম চালু করেছে যা উদ্যোগী এবং কর্পোরেট প্রশিক্ষণে ব্যবহৃত হচ্ছে। এআই প্রযুক্তি এখন এতটাই উন্নত হয়েছে যে ডেভেলপাররা Claude এবং ভিডিও মডেল ব্যবহার করে সম্পূর্ণ চলচ্চিত্র তৈরি করতে পারছেন।
Today's Stories
- 1
Black Forest Labs, Flux 3 প্রকাশ করল নেটিভ অডিও ভিডিও জেনারেশন ক্ষমতা সহ
কী ঘটল: জার্মান এআই কোম্পানি Black Forest Labs, Flux 3 প্রকাশ করেছে, যা একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা চিত্র, ভিডিও এবং অডিও একসাথে শিখে। এই মডেল প্রথমবারের মতো বিশ সেকেন্ড পর্যন্ত নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত লিঙ্ক সমর্থন করে। এটি গুরুত্বপূর্ণ কেন: দশ সেকেন্ডের ক্লিপ এবং সাতশত বিশ পিক্সেলের প্রাথমিক মূল্যায়নে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর উপর পছন্দ পেয়েছে: Luma Ray 3.2 এর চেয়ে তিরানব্বই শতাংশ, Runway Gen-4.5 এর চেয়ে সাতাত্তর শতাংশ এবং Grok Imagine Video এর চেয়ে উনসত্তর শতাংশ। আরও শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash-এর সাথে সমন্বিত বা কাছাকাছি ছিল (প্রতিটি বায়ান্ন শতাংশ পছন্দে), যারা ইতিমধ্যে প্রধান উৎপাদন কর্মপ্রবাহ সেবা করে। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে উৎপাদন কাজে পরীক্ষা করা হচ্ছে, যা স্থাপত্যটি রোবোটিক্স অ্যাপ্লিকেশনে প্রসারিত হওয়ার পরামর্শ দেয়।
কী দেখার মতো: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসের জন্য চালু হওয়ার জন্য নির্ধারিত, জটিল প্রম্পট এবং বহুভাষিক টেক্সট রেন্ডারিংয়ের উন্নতি সহ। অ্যাকশন পূর্বাভাস প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামে মাল্টিমোডাল মেরুদণ্ডের জন্য ওপেন-ওয়েট অ্যাক্সেস দেওয়ার পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ সহ উপলব্ধি, কর্ম এবং ভাষা পূর্বাভাস একত্রিত করে এমন একটি একক মডেলে।
- 2
সৃজনশীল ব্যক্তিত্ব LLM ব্যবহার করে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করে এটিকে ব্যর্থ বলে আখ্যায়িত করেছেন
কী ঘটেছে: একজন বিষয়বস্তু নির্মাতা Claude Fable 5 LLM ব্যবহার করে William Hope Hodgson-এর The House on the Borderland উপন্যাসের একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন, যা তিনি সঙ্গীত ভিডিও এবং AI-উৎপাদিত অ্যালবামগুলির সাথে তাদের YouTube চ্যানেলে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষাটি পরীক্ষা করে যে বৃহৎ ভাষা মডেলগুলি মানুষের হস্তক্ষেপ ছাড়াই সম্পূর্ণ দৈর্ঘ্যের প্রকল্প জুড়ে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এমন একটি প্রশ্ন যা কী ধরনের সৃজনশীল কাজ বর্তমান AI সক্ষমতার বাইরে থাকে তা নিয়ে কথা বলে, এমনকি যখন স্বাধীনভাবে কাজ করার সময় এবং অনুমতি দেওয়া হয়।
যা লক্ষ্য করতে হবে: সৃজনশীল ব্যক্তিত্ব এটি প্রকাশ করা সত্ত্বেও ফলাফলকে ব্যর্থতা হিসাবে প্রণয়ন করেছেন, উল্লেখ করেছেন যে তারা এটি শুধুমাত্র YouTube চ্যানেল মান অনুযায়ী বিচার করেছেন বরং চলচ্চিত্র হিসাবে সম্পূর্ণ বিভাগ হিসাবে নয়; তারা এই ত্রুটি LLM-এর সংস্থা বা পরিকল্পনার জন্য নয় বরং অন্যান্য কারণের জন্য দায়ী করেছেন যা তারা সম্পূর্ণ অংশে আলোচনা করেছেন।
- 3
Black Forest Labs FLUX 3 চালু করেছে ছবি, ভিডিও এবং অডিও তৈরির জন্য
কী ঘটেছে: Black Forest Labs FLUX 3 প্রকাশ করেছে, একটি মাল্টিমোডাল এআই মডেল যা একটি একক প্রম্পট থেকে ছবি এবং সম্মিলিত অডিও/ভিডিও ক্লিপ তৈরি করে যা বিশ সেকেন্ড পর্যন্ত স্থায়ী হয়। মডেলটি আলাদা মডেল সংযুক্ত করার পরিবর্তে ছবি, ভিডিও এবং অডিও জুড়ে যৌথভাবে প্রশিক্ষিত হয়েছে। এটি রোবোটিক দৃষ্টিভঙ্গি এবং কর্মকে বিস্তৃত করে। কেন এটি গুরুত্বপূর্ণ: FLUX 3 কোম্পানির প্রথম জনসাধারণ্য ভিডিও প্রজন্ম মডেল এবং সৃজনশীল প্রজন্ম, সিমুলেশন, কম্পিউটার ব্যবহার এবং রোবোটিক্সকে একটি একক সক্ষমতার সংযুক্ত প্রয়োগ হিসাবে ফ্রেম করে। Black Forest Labs এটিকে "ভিজ্যুয়াল ইন্টেলিজেন্স" হিসাবে অবস্থান করে—মডেল যা শারীরিক এবং ডিজিটাল পরিবেশ জুড়ে উপলব্ধি, পূর্বাভাস এবং কাজ করতে পারে—প্রতিটি মডালিটি একটি পৃথক সরঞ্জাম হিসাবে বিবেচনা করার পরিবর্তে।
যা লক্ষ্য রাখতে হবে: FLUX 3 চারটি পণ্য লাইনের মাধ্যমে অফার করা হবে: FLUX 3 Video, FLUX 3 Image এবং FLUX 3 Act। রিলিজটি শুরুতে সীমিত, যার অর্থ বিস্তৃত উপলব্ধতা বা মূল্য নির্ধারণের বিবরণ পরবর্তীতে অনুসরণ করতে পারে।
- 4
Runway মিডিয়া রাউটার চালু করেছে জেনারেটিভ এআই মডেল পরিচালনা করতে
কী ঘটেছে: Runway বৃহস্পতিবার তার Runway Dev প্ল্যাটফর্মের মাধ্যমে মিডিয়া রাউটার চালু করেছে, যা একটি টুল যা গুণমান, গতি বা খরচের মতো অগ্রাধিকারের ভিত্তিতে স্বয়ংক্রিয়ভাবে ডেভেলপারের অনুরোধের জন্য সেরা ইমেজ, ভিডিও বা অডিও জেনারেশন মডেল নির্বাচন করে। Runway এটিকে জেনারেটিভ মিডিয়ার জন্য বিশেষভাবে তৈরি প্রথম মডেল রাউটার হিসাবে দাবি করছে। কেন এটি গুরুত্বপূর্ণ: জেনারেটিভ মিডিয়া মডেলের সংখ্যা বিস্ফোরকভাবে বৃদ্ধি পেয়েছে, যা ডেভেলপারদের জন্য নতুন রিলিজ মূল্যায়ন করা এবং প্রতিটি কাজের জন্য কোন মডেল সবচেয়ে ভালো তা বুঝা কঠিন করেছে। রাউটার ডেভেলপারদের—Adobe, Cloudflare, ElevenLabs, Expedia, Shutterstock এবং Quora সহ—তাদের পণ্যগুলিতে এপিআই-এর মাধ্যমে সরাসরি মিডিয়া জেনারেশন সংহত করতে দেয়, যখন Runway নিজেকে একটি অর্কেস্ট্রেশন লেয়ার হিসাবে অবস্থান করছে বরং একটি একক মডেলের উপর নির্ভর করার চেয়ে যা এগিয়ে থাকবে বলে আশা করা যায়।
দেখার মতো বিষয়: ডেভেলপাররা রাউটারের নির্বাচন যুক্তির জন্য পছন্দ নির্ধারণ করতে পারে, যার মধ্যে রয়েছে টোকেন মূল্য নির্ধারণ (এজেন্টিক এআই ব্যবহার করে এমন এন্টারপ্রাইজের জন্য ২০২৬ সালে একটি প্রধান খরচের উদ্বেগ) এবং মডেলের উৎপত্তি—উদাহরণস্বরূপ, চীনা মডেলগুলির উপর আমেরিকান সরবরাহকারীদের অগ্রাধিকার দেওয়া যখন Trump প্রশাসন চীনা ওপেন এআই মডেলগুলিতে সম্ভাব্য নিষেধাজ্ঞা অন্বেষণ করছে।
- 5
Synthesia、ভিডিও超え「AI ভূমিকা অনুশীলন」で企業研修に参入
Synthesia launched AI Roleplay Sessions, an interactive training platform where employees practice workplace conversations with AI avatars that provide feedback, scoring, and analytics. The platform moves beyond pre-recorded video training into live, personalized coaching—companies can now measure training effectiveness through analytics instead of relying on static content alone.
This positions Synthesia to compete in the enterprise training market by offering real-time interaction and measurement capabilities that traditional training videos do not provide.
- 6
কৃত্রিম বুদ্ধিমত্তায় চলচ্চিত্র নির্মাণ সহজ করা হয়েছে: একজন ডেভেলপার Claude এবং ভিডিও মডেল ব্যবহার করে সম্পূর্ণ ফিচার ফিল্ম তৈরি করেছেন
কী ঘটেছে: একজন ডেভেলপার Claude (যা পাঠ্য বোঝে এবং তৈরি করে এমন একটি কৃত্রিম বুদ্ধিমত্তা) এবং Seedance ২.০ (একটি ভিডিও তৈরির মডেল) এর সমন্বয় করে একটি সম্পূর্ণ শর্ট ফিল্ম তৈরি করেছেন। কাজটিতে পনেরোটি পুনরাবৃত্তি এবং একটি বহু-পর্যায়ের প্রক্রিয়া জড়িত ছিল: দুই পৃষ্ঠার গল্প প্রম্পট দিয়ে শুরু করে, Claude-এর ব্রেনস্টর্মিং সেশনের মাধ্যমে এটি বিকশিত করা, চরিত্র এবং স্থানের জন্য রেফারেন্স ছবি তৈরি করা, এবং তারপর কৃত্রিম বুদ্ধিমত্তা-উৎপন্ন প্রম্পট ব্যবহার করে প্রতিটি দৃশ্যের জন্য ভিডিও ক্লিপ তৈরি করা। গুরুত্ব কেন: এটি প্রদর্শন করে যে বিশেষজ্ঞ ছাড়াই মানুষ এখন চলচ্চিত্র-মানের কন্টেন্ট তৈরি করতে পারে বিদ্যমান কৃত্রিম বুদ্ধিমত্তার সরঞ্জাম একত্রিত করে, চলচ্চিত্র ক্রু বা ব্যয়বহুল সরঞ্জাম ছাড়াই। লেখক দেখিয়েছেন যে Claude Fable (একটি নতুন মডেল রূপান্তর) এবং Claude Opus (একটি পুরানো রূপান্তর) মাথার বিপরীতে পরীক্ষা করলে তুলনীয় নির্দেশনা গুণমান উৎপাদন করেছে, যার মানে আসল অগ্রগতি হল অ্যাক্সেসযোগ্য সরঞ্জাম চেইনটি নিজেই একটি একক যুগান্তকারী মডেলের চেয়ে।
লক্ষ্য রাখতে হবে: চূড়ান্ত ফিল্মটি YouTube-এ উপলব্ধ (https://www.youtube.com/watch?v=q40M08SOhGs)। পাইপলাইনটি Seedance-এর জন্য API র্যাপার হিসাবে Higgsfield, রেফারেন্স ছবি তৈরির জন্য nano banana, এবং স্ক্রিপ্ট লেখার জন্য Claude Code ব্যবহার করে—এটি এমন একটি স্ট্যাক যা কৃত্রিম বুদ্ধিমত্তা চলচ্চিত্র নির্মাণে আগ্রহী অন্যদের দ্বারা পুনরুৎপাদনযোগ্য মনে হয়।
What to Watch
আগামী কয়েক সপ্তাহে Flux 3 Image-এর প্রাথমিক অ্যাক্সেস এবং BFL-এর মাল্টিমোডাল মডেল Flux 3 Dev-এর ওপেন-ওয়েট সংস্করণের জন্য নজর রাখুন, যা ভিডিও, চিত্র এবং অ্যাকশন পূর্বাভাস একটি একক সিস্টেমে একত্রিত করবে। একই সাথে, এন্টারপ্রাইজ খাতে কৃত্রিম বুদ্ধিমত্তা প্রযুক্তির ব্যবহার বাড়ার সাথে সাথে টোকেন মূল্য নির্ধারণ এবং ভৌগোলিক সরবরাহ শৃঙ্খলের উপর ভিত্তি করে ডেভেলপার পছন্দগুলি কীভাবে বিকশিত হয় তা পর্যবেক্ষণ করুন।
Sources
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
- Synthesia’s AI training platform is moving beyond videos into live coaching
- Making AI Movies
- Neill Blomkamp’s new zombie AI ‘film’ is just slop warmed over
- Accelerating Text-to-Video Generation with Calibrated Sparse Attention
- District 9 director Neill Blomkamp releases first short film made entirely with AI video generation
- LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free