AITodayYour daily AI briefing

Video Generation

Jul 27, 2026

Video Generation

The Gist

Black Forest Labs FLUX 3 নামক একটি নতুন মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করতে পারে এবং নেটিভ অডিও-ভিডিও জেনারেশন সমর্থন করে। একই সাথে, একটি গবেষণা দেখিয়েছে যে এআই দ্বারা তৈরি ভিডিও লেবেল করা সত্ত্বেও মানুষ বাস্তব ভিডিও বিশ্বাস করতে সংকোচ বোধ করছে। এই অগ্রগতি সত্ত্বেও, সৃজনশীল ব্যক্তিত্বরা এখনও LLM ব্যবহার করে সম্পূর্ণ দৈর্ঘ্যের চলচ্চিত্র তৈরিতে চ্যালেঞ্জ মুখোমুখি হচ্ছেন।

Today's Stories

  1. 1

    আত্মকেন্দ্রিক ভিডিও প্রক্রিয়াকরণ প্ল্যাটফর্ম চালু হচ্ছে, ল্যাব অংশীদার খুঁজছে

    কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা আত্মকেন্দ্রিক এবং স্থানিক ভিডিওর জন্য ডেটা প্রস্তুতি (ইটিএল) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (ভিএলএ) মডেল উন্নয়নের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে সেবা বিনামূল্যে পরীক্ষা করার জন্য খোলাভাবে নিয়োগ করছে। এটি কেন গুরুত্বপূর্ণ: ভৌত এআই এবং টেলিপারেশন সিস্টেম তৈরিকারী দলগুলি বর্তমানে ভিডিও ডেটা প্রাক-প্রক্রিয়াকরণে উল্লেখযোগ্য জিপিইউ সময় এবং প্রকৌশল প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা পাইপলাইনিং আপস্ট্রিমে পরিচালনা করে, এটি মূল মডেল কাজের জন্য কম্পিউটেশনাল সম্পদ এবং প্রকৌশল চক্র মুক্ত করে।

    যা লক্ষ্য করতে হবে: অফারটি প্রতিক্রিয়া প্রদানে ইচ্ছুক ল্যাবগুলির মধ্যে সীমাবদ্ধ; আগ্রহী দলগুলিকে মন্তব্য করতে বা অংশগ্রহণ আলোচনা করার জন্য সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হচ্ছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক চালু হওয়ার সময়সূচী উল্লেখ করা হয়নি।

  2. 2

    Midjourney অ্যাস্ট্রোলজি অ্যাপ Co-Star অধিগ্রহণ করেছে

    কী ঘটেছে: ইমেজ এবং ভিডিও জেনারেটরের জন্য পরিচিত এআই ল্যাব Midjourney সোশ্যাল অ্যাস্ট্রোলজি অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star-এর প্রায় দুই ডজন কর্মচারীর দল Midjourney-তে যোগদান করেছে। কেন এটি গুরুত্বপূর্ণ: Co-Star-এর প্রতি মাসে প্রায় ৪৩ লক্ষ সক্রিয় ব্যবহারকারী রয়েছে এবং এটি হোরোস্কোপ ও জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরিতে এআই এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney-র মূল ইমেজ-জেনারেশন ব্যবসার বাইরে ভোক্তা-কেন্দ্রিক অ্যাপে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ তৈরির প্রচেষ্টার পরবর্তী ধাপ।

    লক্ষ্য রাখতে হবে: Midjourney বর্তমানে প্রধানত Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দল ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা রাখে, যা ইঙ্গিত করে যে Midjourney অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে।

  3. 3

    Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত

    কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ইমেজ, ভিডিও, অডিও প্রজন্ম এবং অ্যাকশন পূর্বাভাস পরিচালনা করে। কোম্পানি FLUX-mimic ও উন্মোচন করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3-এর উপর নির্মিত এবং Audi-এর সাথে একটি একক অন-প্রিমাইসেস GPU-তে বাস্তব কারখানা স্থাপনার জন্য পরীক্ষা করা হয়েছে। এটি কেন গুরুত্বপূর্ণ: FLUX 3 অন্যান্য শীর্ষস্থানীয় ল্যাবগুলির দ্বারা আলাদাভাবে প্রদর্শিত সক্ষমতাগুলি পুনরুৎপাদন এবং প্রসারিত করে (Gemini Omni, Grok Imagine, Seedance 2.0), এবং দলটি একটি ওপেন-ওয়েট ডেভেলপার সংস্করণ খোলার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স প্রয়োগটি সংকেত দেয় যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে হস্তান্তর করা যায়, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভর ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল নির্মাণকারী ল্যাবগুলির জন্য বাধা কমায়।

    লক্ষ্য রাখুন: FLUX 3 ভিডিও বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। মডেলের ইমেজ, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণকে একটি আর্কিটেকচারে একীভূত করার ক্ষমতা—যৌথভাবে প্রশিক্ষিত বনাম আলাদা মডিউল হিসাবে—এটি নির্ধারণ করবে মাল্টিমোডাল সিস্টেমগুলি শিল্পের মান হয়ে উঠবে নাকি কাজের দ্বারা বিভক্ত থাকবে।

  4. 4

    এআই ভিডিও লেবেল করা সত্ত্বেও বাস্তব ভিডিওতে আস্থা কাঁপিয়ে দেয়, গবেষণায় দেখা গেছে

    কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীদের নিয়ে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন, যেখানে এআই-উৎপাদিত ভিডিওর সংস্পর্শে আসা দল এবং মানব-উৎপাদিত ভিডিও দেখা নিয়ন্ত্রণ দলের তুলনা করা হয়েছে। এআই-সংস্পর্শ দল পরে নিয়ন্ত্রণ দলের সাথে মানব-উৎপাদিত বিষয়বস্তু দেখেছে এবং পরবর্তী ভিডিওর সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারে আস্থা হ্রাস, বৃহত্তর উপলব্ধিগত বিঘ্ন এবং কম সামাজিক সংযোগ রিপোর্ট করেছে—যদিও সিন্থেটিক বিষয়বস্তুটি এআই-উৎপাদিত ছিল তা স্পষ্টভাবে প্রকাশ করা হয়েছিল। এটি কেন গুরুত্বপূর্ণ: এই গবেষণা প্রকাশ করে যে কেবল এআই-উৎপাদিত ভিডিওতে লেবেল করা বাস্তব ভিডিওতে দর্শকদের আস্থা ভেঙে দেওয়া থেকে বিরত করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক বিষয়বস্তু দেখার মনস্তাত্ত্বিক এবং উপলব্ধিগত প্রভাব খাঁটি ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানেন। প্ল্যাটফর্ম এবং বিষয়বস্তু নির্মাতাদের জন্য, এটি নির্ধারণ এবং প্রকাশের বাইরে কৌশল প্রয়োজন নির্দেশ করে যা মানুষ কীভাবে দৃশ্যমান মিডিয়া অনুভব করে এবং বিশ্বাস করে তা রক্ষা করতে।

    লক্ষ্য রাখার মতো বিষয়: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলিকে এআই-উৎপাদিত ভিডিও সংস্পর্শের অভিজ্ঞতামূলক এবং মনস্তাত্ত্বিক প্রভাবের সমাধান করতে হবে, শুধুমাত্র নকল থেকে বাস্তবকে আলাদা করার উপর ফোকাস করবে না। গবেষণাটি কম্পিউটিং সিস্টেমে মানব কারণ সম্পর্কে ২০২৬ CHI সম্মেলনে উপস্থাপিত হয়েছিল।

  5. 5

    Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশন সহ

    কী ঘটেছে: জার্মান AI কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। এই মডেল প্রথমবারের মতো বিশ সেকেন্ড পর্যন্ত দৈর্ঘ্যের নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত লিঙ্কগুলি সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: দশ সেকেন্ডের ক্লিপ এবং ৭২০পি রেজোলিউশনে প্রাথমিক মূল্যায়নে Flux 3 একাধিক প্রতিযোগীর উপর পছন্দ পেয়েছে: Luma Ray 3.2-এর চেয়ে ৯৩ শতাংশ, Runway Gen-4.5-এর চেয়ে ৭৭ শতাংশ এবং Grok Imagine Video-এর চেয়ে ৬৯ শতাংশ। শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash-এর সাথে সমান বা কাছাকাছি কর্মক্ষমতা দেখিয়েছে (প্রতিটি ৫২ শতাংশ পছন্দ), যারা ইতিমধ্যে প্রধান প্রোডাকশন ওয়ার্কফ্লো পরিবেশন করছে। BFL তাছাড়া Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রোডাকশন কাজে পরীক্ষা করা হচ্ছে, যা পরামর্শ দেয় যে এই আর্কিটেকচার রোবোটিক্স অ্যাপ্লিকেশনে প্রসারিত হতে পারে।

    লক্ষ্য রাখুন: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে আর্লি অ্যাক্সেসে চালু হতে চলেছে, জটিল প্রম্পট এবং বহুভাষিক টেক্সট রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন প্রিডিকশন প্রাথমিকভাবে নির্বাচিত পার্টনারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নাম অনুযায়ী মাল্টিমোডাল ব্যাকবোনে ওপেন-ওয়েট অ্যাক্সেস পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ হিসেবে উপলব্ধি, অ্যাকশন এবং ভাষা প্রিডিকশন একত্রিত করে এমন একটি একক মডেল তৈরিতে।

  6. 6

    সৃজনশীল ব্যক্তিত্ব LLM দিয়ে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করেছেন, এটিকে ব্যর্থতা বলে অভিহিত করেছেন

    কী ঘটেছে: একজন সামগ্রী সৃষ্টিকারী Claude Fable 5 নামক একটি LLM ব্যবহার করে William Hope Hodgson-এর 'The House on the Borderland'-এর একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন এবং সংগীত ভিডিও ও AI-উত্পাদিত অ্যালবামগুলির সাথে তাদের YouTube চ্যানেলে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষা পরীক্ষা করে যে বড় ভাষা মডেলগুলি মানব হস্তক্ষেপ ছাড়াই একটি সম্পূর্ণ দৈর্ঘ্যের প্রকল্প জুড়ে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এমন একটি প্রশ্ন যা বর্তমান AI সক্ষমতার বাইরে কী ধরনের সৃজনশীল কাজ রয়ে গেছে তা নির্দেশ করে, এমনকি যখন তাদের স্বাধীনভাবে কাজ করার সময় এবং অনুমতি দেওয়া হয়।

    লক্ষ্য রাখুন: সৃষ্টিকারী এটি প্রকাশ করা সত্ত্বেও ফলাফলটিকে একটি ব্যর্থতা হিসাবে উপস্থাপন করেছেন, উল্লেখ করে যে তারা এটি শুধুমাত্র YouTube চ্যানেল মান অনুযায়ী বিচার করেছেন বরং সম্পূর্ণ বিভাগ হিসাবে চলচ্চিত্রের চেয়ে; তারা এই ঘাটতি LLM-এর এজেন্সি বা পরিকল্পনার জন্য নয়, বরং অন্যান্য কারণের জন্য দায়ী করেন যা তারা সম্পূর্ণ নিবন্ধে আলোচনা করেন।

What to Watch

আগামী সপ্তাহগুলিতে Flux 3 Image এবং Flux 3 Video-এর প্রাথমিক অ্যাক্সেস সম্প্রসারণ দেখুন, যেখানে মাল্টিমোডাল ক্ষমতা এবং ডিজাইন নীতিগুলি কীভাবে AI-উৎপাদিত সামগ্রীর প্রভাব নির্ধারণ করে তা পর্যবেক্ষণ করুন। একই সাথে, Midjourney-এর সম্ভাব্য স্বতন্ত্র অ্যাপ্লিকেশন এবং BFL-এর দীর্ঘমেয়াদী মাল্টিমোডাল মডেল উন্নয়নের দিকে নজর রাখুন, যা ভিডিও প্রজন্মের শিল্পে পরবর্তী বড় পরিবর্তন আনতে পারে।

Sources

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free