AITodayYour daily AI briefing

Video Generation

Jul 23, 2026

Video Generation

The Gist

Black Forest Labs তাদের নতুন Flux 3 মডেল প্রকাশ করেছে যা নেটিভ অডিও এবং ভিডিও জেনারেশন ক্ষমতা সহ ছবি, ভিডিও এবং অডিও সবকিছু তৈরি করতে পারে। একই সাথে Runway মিডিয়া রাউটার এবং Synthesia এআই ভিডিও তৈরির সরঞ্জাম চালু করেছে যা উদ্যোগী এবং কর্পোরেট প্রশিক্ষণে ব্যবহৃত হচ্ছে। এআই প্রযুক্তি এখন এতটাই উন্নত হয়েছে যে ডেভেলপাররা Claude এবং ভিডিও মডেল ব্যবহার করে সম্পূর্ণ চলচ্চিত্র তৈরি করতে পারছেন।

Today's Stories

  1. 1

    Black Forest Labs, Flux 3 প্রকাশ করল নেটিভ অডিও ভিডিও জেনারেশন ক্ষমতা সহ

    কী ঘটল: জার্মান এআই কোম্পানি Black Forest Labs, Flux 3 প্রকাশ করেছে, যা একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা চিত্র, ভিডিও এবং অডিও একসাথে শিখে। এই মডেল প্রথমবারের মতো বিশ সেকেন্ড পর্যন্ত নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত লিঙ্ক সমর্থন করে। এটি গুরুত্বপূর্ণ কেন: দশ সেকেন্ডের ক্লিপ এবং সাতশত বিশ পিক্সেলের প্রাথমিক মূল্যায়নে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর উপর পছন্দ পেয়েছে: Luma Ray 3.2 এর চেয়ে তিরানব্বই শতাংশ, Runway Gen-4.5 এর চেয়ে সাতাত্তর শতাংশ এবং Grok Imagine Video এর চেয়ে উনসত্তর শতাংশ। আরও শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash-এর সাথে সমন্বিত বা কাছাকাছি ছিল (প্রতিটি বায়ান্ন শতাংশ পছন্দে), যারা ইতিমধ্যে প্রধান উৎপাদন কর্মপ্রবাহ সেবা করে। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে উৎপাদন কাজে পরীক্ষা করা হচ্ছে, যা স্থাপত্যটি রোবোটিক্স অ্যাপ্লিকেশনে প্রসারিত হওয়ার পরামর্শ দেয়।

    কী দেখার মতো: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসের জন্য চালু হওয়ার জন্য নির্ধারিত, জটিল প্রম্পট এবং বহুভাষিক টেক্সট রেন্ডারিংয়ের উন্নতি সহ। অ্যাকশন পূর্বাভাস প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামে মাল্টিমোডাল মেরুদণ্ডের জন্য ওপেন-ওয়েট অ্যাক্সেস দেওয়ার পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ সহ উপলব্ধি, কর্ম এবং ভাষা পূর্বাভাস একত্রিত করে এমন একটি একক মডেলে।

  2. 2

    সৃজনশীল ব্যক্তিত্ব LLM ব্যবহার করে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করে এটিকে ব্যর্থ বলে আখ্যায়িত করেছেন

    কী ঘটেছে: একজন বিষয়বস্তু নির্মাতা Claude Fable 5 LLM ব্যবহার করে William Hope Hodgson-এর The House on the Borderland উপন্যাসের একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন, যা তিনি সঙ্গীত ভিডিও এবং AI-উৎপাদিত অ্যালবামগুলির সাথে তাদের YouTube চ্যানেলে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষাটি পরীক্ষা করে যে বৃহৎ ভাষা মডেলগুলি মানুষের হস্তক্ষেপ ছাড়াই সম্পূর্ণ দৈর্ঘ্যের প্রকল্প জুড়ে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এমন একটি প্রশ্ন যা কী ধরনের সৃজনশীল কাজ বর্তমান AI সক্ষমতার বাইরে থাকে তা নিয়ে কথা বলে, এমনকি যখন স্বাধীনভাবে কাজ করার সময় এবং অনুমতি দেওয়া হয়।

    যা লক্ষ্য করতে হবে: সৃজনশীল ব্যক্তিত্ব এটি প্রকাশ করা সত্ত্বেও ফলাফলকে ব্যর্থতা হিসাবে প্রণয়ন করেছেন, উল্লেখ করেছেন যে তারা এটি শুধুমাত্র YouTube চ্যানেল মান অনুযায়ী বিচার করেছেন বরং চলচ্চিত্র হিসাবে সম্পূর্ণ বিভাগ হিসাবে নয়; তারা এই ত্রুটি LLM-এর সংস্থা বা পরিকল্পনার জন্য নয় বরং অন্যান্য কারণের জন্য দায়ী করেছেন যা তারা সম্পূর্ণ অংশে আলোচনা করেছেন।

  3. 3

    Black Forest Labs FLUX 3 চালু করেছে ছবি, ভিডিও এবং অডিও তৈরির জন্য

    কী ঘটেছে: Black Forest Labs FLUX 3 প্রকাশ করেছে, একটি মাল্টিমোডাল এআই মডেল যা একটি একক প্রম্পট থেকে ছবি এবং সম্মিলিত অডিও/ভিডিও ক্লিপ তৈরি করে যা বিশ সেকেন্ড পর্যন্ত স্থায়ী হয়। মডেলটি আলাদা মডেল সংযুক্ত করার পরিবর্তে ছবি, ভিডিও এবং অডিও জুড়ে যৌথভাবে প্রশিক্ষিত হয়েছে। এটি রোবোটিক দৃষ্টিভঙ্গি এবং কর্মকে বিস্তৃত করে। কেন এটি গুরুত্বপূর্ণ: FLUX 3 কোম্পানির প্রথম জনসাধারণ্য ভিডিও প্রজন্ম মডেল এবং সৃজনশীল প্রজন্ম, সিমুলেশন, কম্পিউটার ব্যবহার এবং রোবোটিক্সকে একটি একক সক্ষমতার সংযুক্ত প্রয়োগ হিসাবে ফ্রেম করে। Black Forest Labs এটিকে "ভিজ্যুয়াল ইন্টেলিজেন্স" হিসাবে অবস্থান করে—মডেল যা শারীরিক এবং ডিজিটাল পরিবেশ জুড়ে উপলব্ধি, পূর্বাভাস এবং কাজ করতে পারে—প্রতিটি মডালিটি একটি পৃথক সরঞ্জাম হিসাবে বিবেচনা করার পরিবর্তে।

    যা লক্ষ্য রাখতে হবে: FLUX 3 চারটি পণ্য লাইনের মাধ্যমে অফার করা হবে: FLUX 3 Video, FLUX 3 Image এবং FLUX 3 Act। রিলিজটি শুরুতে সীমিত, যার অর্থ বিস্তৃত উপলব্ধতা বা মূল্য নির্ধারণের বিবরণ পরবর্তীতে অনুসরণ করতে পারে।

  4. 4

    Runway মিডিয়া রাউটার চালু করেছে জেনারেটিভ এআই মডেল পরিচালনা করতে

    কী ঘটেছে: Runway বৃহস্পতিবার তার Runway Dev প্ল্যাটফর্মের মাধ্যমে মিডিয়া রাউটার চালু করেছে, যা একটি টুল যা গুণমান, গতি বা খরচের মতো অগ্রাধিকারের ভিত্তিতে স্বয়ংক্রিয়ভাবে ডেভেলপারের অনুরোধের জন্য সেরা ইমেজ, ভিডিও বা অডিও জেনারেশন মডেল নির্বাচন করে। Runway এটিকে জেনারেটিভ মিডিয়ার জন্য বিশেষভাবে তৈরি প্রথম মডেল রাউটার হিসাবে দাবি করছে। কেন এটি গুরুত্বপূর্ণ: জেনারেটিভ মিডিয়া মডেলের সংখ্যা বিস্ফোরকভাবে বৃদ্ধি পেয়েছে, যা ডেভেলপারদের জন্য নতুন রিলিজ মূল্যায়ন করা এবং প্রতিটি কাজের জন্য কোন মডেল সবচেয়ে ভালো তা বুঝা কঠিন করেছে। রাউটার ডেভেলপারদের—Adobe, Cloudflare, ElevenLabs, Expedia, Shutterstock এবং Quora সহ—তাদের পণ্যগুলিতে এপিআই-এর মাধ্যমে সরাসরি মিডিয়া জেনারেশন সংহত করতে দেয়, যখন Runway নিজেকে একটি অর্কেস্ট্রেশন লেয়ার হিসাবে অবস্থান করছে বরং একটি একক মডেলের উপর নির্ভর করার চেয়ে যা এগিয়ে থাকবে বলে আশা করা যায়।

    দেখার মতো বিষয়: ডেভেলপাররা রাউটারের নির্বাচন যুক্তির জন্য পছন্দ নির্ধারণ করতে পারে, যার মধ্যে রয়েছে টোকেন মূল্য নির্ধারণ (এজেন্টিক এআই ব্যবহার করে এমন এন্টারপ্রাইজের জন্য ২০২৬ সালে একটি প্রধান খরচের উদ্বেগ) এবং মডেলের উৎপত্তি—উদাহরণস্বরূপ, চীনা মডেলগুলির উপর আমেরিকান সরবরাহকারীদের অগ্রাধিকার দেওয়া যখন Trump প্রশাসন চীনা ওপেন এআই মডেলগুলিতে সম্ভাব্য নিষেধাজ্ঞা অন্বেষণ করছে।

  5. 5

    Synthesia、ভিডিও超え「AI ভূমিকা অনুশীলন」で企業研修に参入

    Synthesia launched AI Roleplay Sessions, an interactive training platform where employees practice workplace conversations with AI avatars that provide feedback, scoring, and analytics. The platform moves beyond pre-recorded video training into live, personalized coaching—companies can now measure training effectiveness through analytics instead of relying on static content alone.

    This positions Synthesia to compete in the enterprise training market by offering real-time interaction and measurement capabilities that traditional training videos do not provide.

  6. 6

    কৃত্রিম বুদ্ধিমত্তায় চলচ্চিত্র নির্মাণ সহজ করা হয়েছে: একজন ডেভেলপার Claude এবং ভিডিও মডেল ব্যবহার করে সম্পূর্ণ ফিচার ফিল্ম তৈরি করেছেন

    কী ঘটেছে: একজন ডেভেলপার Claude (যা পাঠ্য বোঝে এবং তৈরি করে এমন একটি কৃত্রিম বুদ্ধিমত্তা) এবং Seedance ২.০ (একটি ভিডিও তৈরির মডেল) এর সমন্বয় করে একটি সম্পূর্ণ শর্ট ফিল্ম তৈরি করেছেন। কাজটিতে পনেরোটি পুনরাবৃত্তি এবং একটি বহু-পর্যায়ের প্রক্রিয়া জড়িত ছিল: দুই পৃষ্ঠার গল্প প্রম্পট দিয়ে শুরু করে, Claude-এর ব্রেনস্টর্মিং সেশনের মাধ্যমে এটি বিকশিত করা, চরিত্র এবং স্থানের জন্য রেফারেন্স ছবি তৈরি করা, এবং তারপর কৃত্রিম বুদ্ধিমত্তা-উৎপন্ন প্রম্পট ব্যবহার করে প্রতিটি দৃশ্যের জন্য ভিডিও ক্লিপ তৈরি করা। গুরুত্ব কেন: এটি প্রদর্শন করে যে বিশেষজ্ঞ ছাড়াই মানুষ এখন চলচ্চিত্র-মানের কন্টেন্ট তৈরি করতে পারে বিদ্যমান কৃত্রিম বুদ্ধিমত্তার সরঞ্জাম একত্রিত করে, চলচ্চিত্র ক্রু বা ব্যয়বহুল সরঞ্জাম ছাড়াই। লেখক দেখিয়েছেন যে Claude Fable (একটি নতুন মডেল রূপান্তর) এবং Claude Opus (একটি পুরানো রূপান্তর) মাথার বিপরীতে পরীক্ষা করলে তুলনীয় নির্দেশনা গুণমান উৎপাদন করেছে, যার মানে আসল অগ্রগতি হল অ্যাক্সেসযোগ্য সরঞ্জাম চেইনটি নিজেই একটি একক যুগান্তকারী মডেলের চেয়ে।

    লক্ষ্য রাখতে হবে: চূড়ান্ত ফিল্মটি YouTube-এ উপলব্ধ (https://www.youtube.com/watch?v=q40M08SOhGs)। পাইপলাইনটি Seedance-এর জন্য API র্যাপার হিসাবে Higgsfield, রেফারেন্স ছবি তৈরির জন্য nano banana, এবং স্ক্রিপ্ট লেখার জন্য Claude Code ব্যবহার করে—এটি এমন একটি স্ট্যাক যা কৃত্রিম বুদ্ধিমত্তা চলচ্চিত্র নির্মাণে আগ্রহী অন্যদের দ্বারা পুনরুৎপাদনযোগ্য মনে হয়।

What to Watch

আগামী কয়েক সপ্তাহে Flux 3 Image-এর প্রাথমিক অ্যাক্সেস এবং BFL-এর মাল্টিমোডাল মডেল Flux 3 Dev-এর ওপেন-ওয়েট সংস্করণের জন্য নজর রাখুন, যা ভিডিও, চিত্র এবং অ্যাকশন পূর্বাভাস একটি একক সিস্টেমে একত্রিত করবে। একই সাথে, এন্টারপ্রাইজ খাতে কৃত্রিম বুদ্ধিমত্তা প্রযুক্তির ব্যবহার বাড়ার সাথে সাথে টোকেন মূল্য নির্ধারণ এবং ভৌগোলিক সরবরাহ শৃঙ্খলের উপর ভিত্তি করে ডেভেলপার পছন্দগুলি কীভাবে বিকশিত হয় তা পর্যবেক্ষণ করুন।

Sources

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free