AITodayYour daily AI briefing

Video Generation

Jul 24, 2026

Video Generation

The Gist

ভিডিও জেনারেশন প্রযুক্তিতে আজ বড় অগ্রগতি হয়েছে - Black Forest Labs তাদের নতুন FLUX 3 মডেল লঞ্চ করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করে এবং নেটিভ অডিও-ভিডিও জেনারেশন সক্ষম করে। একই সাথে, একটি নতুন গবেষণায় দেখা গেছে যে AI দিয়ে লেবেল করা ভিডিওগুলি মানুষের বাস্তব ভিডিওর প্রতি আস্থা কমিয়ে দেয়, যা এই প্রযুক্তির সামাজিক প্রভাব নিয়ে প্রশ্ন তোলে।

Today's Stories

  1. 1

    ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু হল, ল্যাব পার্টনার খুঁজছে

    কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা ইগোসেন্ট্রিক এবং স্প্যাশিয়াল ভিডিওর জন্য ডেটা প্রস্তুতি (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য খোলাভাবে নিয়োগ দিচ্ছে। এটি কেন গুরুত্বপূর্ণ: শারীরিক কৃত্রিম বুদ্ধিমত্তা এবং টেলিঅপারেশন সিস্টেম তৈরি করছে এমন দলগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং ইঞ্জিনিয়ারিং প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্ম দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা প্লাম্বিং আপস্ট্রিমে পরিচালনা করে, এটি কম্পিউটেশনাল সংস্থান এবং ইঞ্জিনিয়ারিং চক্র মূল মডেল কাজের জন্য মুক্ত করে।

    যা লক্ষ্য রাখতে হবে: অফারটি প্রতিক্রিয়া প্রদানে ইচ্ছুক ল্যাবগুলির জন্য সীমাবদ্ধ; আগ্রহী দলগুলিকে অংশগ্রহণ আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক চালু করার সময়সূচী উল্লেখ করা হয়নি।

  2. 2

    Midjourney অধিগ্রহণ করেছে Co-Star জ্যোতিষ অ্যাপ

    কী ঘটেছে: Midjourney, একটি AI ল্যাব যা ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত, সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star-এর প্রায় চব্বিশ জন কর্মচারীর দল Midjourney-তে যোগদান করেছেন। কেন এটি গুরুত্বপূর্ণ: Co-Star-এর প্রতি মাসে প্রায় চল্লিশ লক্ষ সক্রিয় ব্যবহারকারী রয়েছে এবং এটি রাশিফল এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে AI এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney-র মূল ছবি-জেনারেশন ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ গড়ার প্রচেষ্টার পরে আসে।

    লক্ষ রাখতে হবে: Midjourney বর্তমানে প্রধানত Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দলের ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা পরামর্শ দেয় যে Midjourney অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে।

  3. 3

    Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত

    কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও তৈরি এবং অ্যাকশন প্রেডিকশন সামলায়। কোম্পানি FLUX-mimic ও অনাবৃত করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3-এর উপর নির্মিত এবং একটি একক অন-প্রিমাইসেস GPU-তে বাস্তব ফ্যাক্টরি স্থাপনার জন্য Audi-এর সাথে পরীক্ষা করা হয়েছে। এর গুরুত্ব কেন: FLUX 3 অন্যান্য অগ্রগামী ল্যাব দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতা প্রজনন এবং প্রসারিত করে (Gemini Omni, Grok Imagine, Seedance 2.0), দলটি একটি খোলা-ওয়েট ডেভেলপার সংস্করণ চালু করার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স অ্যাপ্লিকেশনটি ইঙ্গিত করে যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক খোলা মডেল তৈরি করে এমন ল্যাবগুলির জন্য বাধা হ্রাস করে।

    নজর রাখার বিষয়: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। একটি একক আর্কিটেকচারে ছবি, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণকে একীভূত করার মডেলের ক্ষমতা—যৌথভাবে প্রশিক্ষিত বরং পৃথক মডিউল হিসাবে নয়—মাল্টিমোডাল সিস্টেমগুলি শিল্পের মান হয়ে ওঠে নাকি টাস্কের দ্বারা খণ্ডিত থাকে তা নির্ধারণ করবে।

  4. 4

    AI ভিডিও লেবেল করা থাকলেও বাস্তব ভিডিওর প্রতি আস্থা কমায়, গবেষণায় দেখা গেছে

    কী ঘটেছে: গবেষণকরা একশত জন অংশগ্রহণকারী নিয়ে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন, যেখানে AI-উৎপন্ন ভিডিও দেখা গ্রুপের সাথে মানুষের তৈরি ভিডিও দেখা নিয়ন্ত্রণ গ্রুপের তুলনা করা হয়েছে। AI-সম্পর্কিত গ্রুপ তারপর নিয়ন্ত্রণ গ্রুপের সাথে মানুষের তৈরি কন্টেন্ট দেখেছে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারের প্রতি আস্থা হ্রাস, উচ্চতর উপলব্ধিমূলক ব্যাঘাত এবং কম সামাজিক সংযোগ রিপোর্ট করেছে—যদিও সিন্থেটিক কন্টেন্ট AI-উৎপন্ন তা স্পষ্টভাবে প্রকাশ করা হয়েছিল। কেন এটি গুরুত্বপূর্ণ: গবেষণার ফলাফল প্রকাশ করে যে AI-উৎপন্ন ভিডিওগুলিতে সহজ লেবেল লাগানো বাস্তব ভিডিওগুলির প্রতি দর্শকদের আস্থা কমানো থেকে রোধ করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত কৃত্রিম কন্টেন্ট দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিমূলক প্রভাব প্রকৃত ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানেন। প্ল্যাটফর্ম এবং কন্টেন্ট নির্মাতাদের জন্য, এটি নির্দেশ করে যে লোকেরা দৃশ্যমান মিডিয়া অভিজ্ঞতা এবং বিশ্বাস করে তা রক্ষা করার জন্য সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলগুলির প্রয়োজন।

    কী লক্ষ্য রাখতে হবে: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলি AI-উৎপন্ন ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সমাধান করতে হবে, শুধুমাত্র জাল থেকে বাস্তবকে আলাদা করার উপর ফোকাস করা নয়। গবেষণাটি 2026 সালের CHI Conference on Human Factors in Computing Systems-এ উপস্থাপন করা হয়েছিল।

  5. 5

    Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশন সহ

    কী ঘটেছে: জার্মান এআই কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ইমেজ, ভিডিও এবং অডিও একসাথে শিখে। এই মডেলটি প্রথমবারের মতো নেটিভ অডিওসহ বিশ সেকেন্ড পর্যন্ত দীর্ঘ ভিডিও জেনারেট করতে পারে এবং টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত লিঙ্ক সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: প্রাথমিক মূল্যায়নে দশ সেকেন্ডের ক্লিপ ব্যবহার করে ৭২০পি রেজোলিউশনে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর চেয়ে পছন্দসই ছিল: Luma Ray 3.2 এর চেয়ে ৯৩ শতাংশ, Runway Gen-4.5 এর চেয়ে ৭৭ শতাংশ, এবং Grok Imagine Video এর চেয়ে ৬৯ শতাংশ। শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash এর সাথে সমান অথবা কাছাকাছি ছিল (প্রতিটি ৫২ শতাংশ পছন্দ), যারা ইতিমধ্যে প্রধান প্রোডাকশন ওয়ার্কফ্লো সেবা করে। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রোডাকশন কাজে পরীক্ষা করা হচ্ছে, যা স্থাপত্য রোবোটিক্স অ্যাপ্লিকেশনে প্রসারিত হয় এমন পরামর্শ দেয়।

    কী দেখতে হবে: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে আর্লি অ্যাক্সেসে চালু করার জন্য নির্ধারিত, যা জটিল প্রম্পট এবং বহুভাষিক পাঠ রেন্ডারিং উন্নত করে। অ্যাকশন প্রিডিকশন প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামের অধীন মাল্টিমোডাল ব্যাকবোন অ্যাক্সেস খোলার পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজ একটি একক মডেল একত্রিত করে পারসেপশন, অ্যাকশন এবং ভাষা পূর্বাভাস সহ।

  6. 6

    সৃজনশীল নির্মাতা LLM ব্যবহার করে পূর্ণদৈর্ঘ্য চলচ্চিত্র তৈরি করলেন, এটিকে ব্যর্থতা বলে অভিহিত করলেন

    কী ঘটেছে: একজন কন্টেন্ট ক্রিয়েটর Claude Fable 5 ব্যবহার করে William Hope Hodgson-এর The House on the Borderland উপন্যাসের একটি পূর্ণদৈর্ঘ্য চলচ্চিত্র অভিযোজন তৈরি করেছেন, যা তিনি তাদের YouTube চ্যানেলে সংগীত ভিডিও এবং AI-উৎপাদিত অ্যালবামের সাথে আপলোড করেছেন। এটি কেন গুরুত্বপূর্ণ: এই পরীক্ষাটি পরীক্ষা করে যে বড় ভাষা মডেলগুলি মানব হস্তক্ষেপ ছাড়াই একটি সম্পূর্ণ-দৈর্ঘ্য প্রকল্পে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এটি এমন একটি প্রশ্ন যা নির্দেশ করে কোন ধরনের সৃজনশীল কাজ বর্তমান AI ক্ষমতার বাইরে থাকে, এমনকি স্বাধীনভাবে কাজ করার সময় এবং অনুমতি দেওয়া হলেও।

    যা লক্ষ্য করতে হবে: সৃজনশীলকর্মী এটি প্রকাশ করা সত্ত্বেও ফলাফলটিকে একটি ব্যর্থতা হিসাবে উপস্থাপন করেন, উল্লেখ করে যে তারা এটিকে সমগ্র চলচ্চিত্র বিভাগের পরিবর্তে শুধুমাত্র YouTube চ্যানেল মানদণ্ড অনুসারে মূল্যায়ন করেছেন; তারা এই ত্রুটিটি LLM-এর দায়িত্ব বা পরিকল্পনার জন্য নয়, বরং অন্যান্য কারণের জন্য দায়ী করেন যা তারা সম্পূর্ণ নিবন্ধে আলোচনা করেছেন।

What to Watch

আগামী দিনগুলিতে নজর রাখুন Midjourney-র সম্ভাব্য স্বতন্ত্র অ্যাপ্লিকেশন লঞ্চ এবং Flux 3 Image ও Action Prediction টুলের প্রাথমিক অ্যাক্সেস চালুর জন্য, যা AI-উৎপন্ন ভিডিও এবং ইমেজ প্রযুক্তির ক্ষেত্রে একটি নতুন যুগের সূচনা করবে। একই সাথে, AI সিস্টেমগুলিকে কীভাবে ডিজাইন ও নীতি তৈরি করা হয় তার মাধ্যমে ব্যবহারকারীদের মানসিক এবং অভিজ্ঞতামূলক প্রভাবের উপর কী প্রভাব ফেলে তা বোঝা কতটা গুরুত্বপূর্ণ তা নিয়ে গবেষণার ফলাফলগুলি শিল্পের মানদণ্ড তৈরি করবে।

Sources

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free