AITodayYour daily AI briefing

Video Generation

Jul 25, 2026

Video Generation

The Gist

ভিডিও জেনারেশন প্রযুক্তিতে বড় অগ্রগতি হচ্ছে - Black Forest Labs তাদের নতুন FLUX 3 মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স জুড়ে কাজ করে, এবং Midjourney জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে সৃজনশীল সরঞ্জাম সম্প্রসারণের জন্য। তবে গবেষণা দেখাচ্ছে যে AI-উৎপাদিত ভিডিও লেবেল করা সত্ত্বেও মানুষের আসল ভিডিওতে বিশ্বাস কমিয়ে দেয়, যা এই প্রযুক্তির নৈতিক চ্যালেঞ্জ তুলে ধরে।

Today's Stories

  1. 1

    ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু হচ্ছে, ল্যাব পার্টনার খুঁজছে

    কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা ইগোসেন্ট্রিক এবং স্পেশাল ভিডিওর জন্য ডেটা প্রস্তুতি (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য খোলাভাবে নিয়োগ দিচ্ছে। কেন এটি গুরুত্বপূর্ণ: ফিজিক্যাল AI এবং টেলিঅপারেশন সিস্টেম নির্মাণকারী দলগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং প্রকৌশল প্রচেষ্টা ব্যয় করে—যা এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা প্লাম্বিং আপস্ট্রিমে পরিচালনা করে, এটি গণনামূলক সংস্থান এবং মূল মডেল কাজের জন্য প্রকৌশল চক্রকে মুক্ত করে।

    কী নজর রাখতে হবে: অফারটি প্রতিক্রিয়া প্রদানে ইচ্ছুক ল্যাবগুলির জন্য সীমাবদ্ধ; আগ্রহী দলগুলিকে অংশগ্রহণ নিয়ে আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক লঞ্চ সময়সূচী বলা হয়নি।

  2. 2

    Midjourney অধিগ্রহণ করেছে জ্যোতিষ অ্যাপ Co-Star

    কী ঘটেছে: Midjourney, যা ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত একটি এআই ল্যাব, সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাদি প্রকাশ করা হয়নি। Co-Star-এর প্রায় দুই ডজন কর্মচারী Midjourney-তে যোগ দিয়েছেন। এটি কেন গুরুত্বপূর্ণ: Co-Star-এর প্রায় ৪৩ লক্ষ মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি কৃত্রিম বুদ্ধিমত্তা এবং মানব লেখার সমন্বয়ে রাশিফল ও জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করে। এই অধিগ্রহণ Midjourney-এর মূল ছবি-প্রজন্ম ব্যবসার বাইরে ভোক্তা-কেন্দ্রিক অ্যাপে সম্প্রসারণের ইঙ্গিত দেয় এবং এটি চিকিৎসা ও স্পা বিভাগ তৈরির প্রচেষ্টার পরবর্তী অংশ।

    যা পর্যবেক্ষণ করতে হবে: Midjourney বর্তমানে প্রাথমিকভাবে Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দল ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা Midjourney-কে অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন তৈরি করতে পারে এই ইঙ্গিত দেয়।

  3. 3

    Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও, রোবোটিক্স জুড়ে বিস্তৃত

    কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও জেনারেশন এবং অ্যাকশন প্রেডিকশন পরিচালনা করে। কোম্পানিটি FLUX-mimic ও উন্মোচন করেছে, একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল যা FLUX 3 এর ভিত্তিতে তৈরি এবং Audi এর সাথে একটি একক অন-প্রিমাইসেস GPU তে বাস্তব ফ্যাক্টরি স্থাপনার জন্য পরীক্ষিত। এটি কেন গুরুত্বপূর্ণ: FLUX 3 অন্যান্য অগ্রণী ল্যাবগুলির দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতাগুলি পুনরুৎপাদন এবং সম্প্রসারিত করে (Gemini Omni, Grok Imagine, Seedance 2.0), দলটি একটি ওপেন-ওয়েটস ডেভেলপার সংস্করণ খোলার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স প্রয়োগটি সংকেত দেয় যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভবত বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরিকারী ল্যাবগুলির জন্য বাধা কমাতে পারে।

    যা দেখতে হবে: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। একটি আর্কিটেকচারে ছবি, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণ একীভূত করার এই মডেলের ক্ষমতা—আলাদা মডিউল হিসাবে নয় বরং যৌথভাবে প্রশিক্ষিত—মাল্টিমোডাল সিস্টেম শিল্পের মান হয়ে উঠবে নাকি কাজ দ্বারা খণ্ডিত থাকবে তা নির্ধারণ করবে।

  4. 4

    AI দ্বারা তৈরি ভিডিও লেবেল করা সত্ত্বেও প্রকৃত ভিডিওর প্রতি বিশ্বাস নষ্ট করে, গবেষণায় দেখা গেছে

    কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীদের সাথে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন, যেখানে AI-উত্পন্ন ভিডিওর সংস্পর্শে আসা গ্রুপকে মানব-উত্পাদিত ভিডিও দেখা নিয়ন্ত্রণ গ্রুপের সাথে তুলনা করা হয়েছিল। AI-সংস্পর্শ গ্রুপ তারপর মানব-উত্পাদিত সামগ্রী দেখেছিল এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের판断ের প্রতি হ্রাসপ্রাপ্ত আস্থা, বৃহত্তর উপলব্ধিগত ব্যাঘাত এবং নিম্ন সামাজিক সংযোগ রিপোর্ট করেছিল—যদিও সিন্থেটিক সামগ্রী AI-উত্পন্ন ছিল তার স্পষ্ট প্রকাশ সত্ত্বেও। কেন এটি গুরুত্বপূর্ণ: এই সন্ধানগুলি প্রকাশ করে যে AI-উত্পাদিত ভিডিওগুলিকে সহজভাবে লেবেল করা প্রকৃত ভিডিওগুলিতে দর্শকদের বিশ্বাস নষ্ট করা থেকে রোধ করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক সামগ্রী দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিগত প্রভাবগুলি খাঁটি ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎস জানেন। প্ল্যাটফর্ম এবং সামগ্রী সৃষ্টিকারীদের জন্য, এটি নকল থেকে প্রকৃত পার্থক্য করার জন্য মানুষ দৃশ্যমান মিডিয়া কীভাবে অভিজ্ঞতা এবং বিশ্বাস করে তা রক্ষা করতে সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলগুলির প্রয়োজন নির্দেশ করে।

    পর্যবেক্ষণীয়: এই গবেষণাটি হাইলাইট করে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই AI-উত্পাদিত ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সম্বোধন করতে হবে, শুধুমাত্র জাল থেকে বাস্তব আলাদা করার উপর দৃষ্টি নিবদ্ধ করতে হবে না। এই গবেষণাটি ২০২৬ CHI Conference on Human Factors in Computing Systems এ উপস্থাপন করা হয়েছিল।

  5. 5

    Black Forest Labs Flux 3 প্রকাশ করল স্থানীয় অডিও ভিডিও উৎপাদন বৈশিষ্ট্য সহ

    কী ঘটল: জার্মান কৃত্রিম বুদ্ধিমত্তা কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি বহুমাত্রিক ভিত্তি মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। মডেলটি প্রথমবারের মতো পঞ্চাশ সেকেন্ড পর্যন্ত স্থানীয় অডিও সহ ভিডিও তৈরি করতে পারে, যা পাঠ্য-থেকে-ভিডিও, ছবি-থেকে-ভিডিও, ভিডিও-থেকে-ভিডিও, কীফ্রেম-ভিত্তিক রূপান্তর, বহুভাষিক সংলাপ এবং ক্লিপগুলির মধ্যে এজেন্ট-চালিত সংযোগ সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: দশ সেকেন্ডের ক্লিপে সাতশ বিশ পিক্সেল রেজোলিউশনে প্রাথমিক মূল্যায়নে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর উপর পছন্দ করা হয়েছে: Luma Ray 3.2 এর উপর তিরানব্বই প্রতিশত, Runway Gen-4.5 এর উপর সাতাত্তর প্রতিশত এবং Grok Imagine Video এর উপর উনসত্তর প্রতিশত। শক্তিশালী প্রতিযোগীদের বিপরীতে, এটি Seedance 2.0 এবং Gemini Omni Flash এর সমান ছিল অথবা কাছাকাছি ছিল (প্রতিটি বায়ান্ন প্রতিশত পছন্দে), যারা ইতিমধ্যে বড় উৎপাদন কর্মপ্রবাহ পরিবেশন করে। BFL এছাড়াও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi এ উৎপাদন কাজে পরীক্ষা করা হচ্ছে, যা পরামর্শ দেয় যে স্থাপত্য রোবোটিক্স প্রয়োগে বিস্তৃত।

    যা লক্ষ্য করতে হবে: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসের জন্য চালু হতে চলেছে, জটিল অনুরোধ এবং বহুভাষিক পাঠ্য রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন ভবিষ্যদ্বাণী প্রথমে নির্বাচিত অংশীদারদের মাধ্যমে প্রদান করা হবে। BFL 'Flux 3 Dev' নামের অধীনে বহুমাত্রিক মেরুদণ্ডে খোলা-ওজন অ্যাক্সেস পরিকল্পনা করছে, উপলব্ধি, অ্যাকশন এবং ভাষা ভবিষ্যদ্বাণী একত্রিত করে এমন একক মডেলের দীর্ঘমেয়াদী কাজ সহ।

  6. 6

    সৃজনশীল নির্মাতা LLM ব্যবহার করে দীর্ঘমেয়াদী চলচ্চিত্র তৈরি করেন, এটিকে ব্যর্থ বলে অভিহিত করেন

    কী ঘটেছে: একজন সামগ্রী সৃষ্টিকারী Claude Fable 5 নামের একটি LLM ব্যবহার করে উইলিয়াম হোপ হডজসনের 'দ্য হাউস অন দ্য বর্ডারল্যান্ড'-এর একটি দীর্ঘমেয়াদী চলচ্চিত্র অভিযোজন তৈরি করেছেন এবং তা তাদের YouTube চ্যানেলে সংগীত ভিডিও এবং AI-উৎপাদিত অ্যালবামের পাশাপাশি আপলোড করেছেন। এটি গুরুত্বপূর্ণ কেন: এই পরীক্ষা-নিরীক্ষা পরীক্ষা করে যে বড় ভাষা মডেলগুলি মানুষের হস্তক্ষেপ ছাড়াই একটি সম্পূর্ণ দীর্ঘমেয়াদী প্রকল্প জুড়ে সৃজনশীল আউটপুট বজায় রাখতে পারে কিনা—এটি এমন একটি প্রশ্ন যা বর্তমান AI ক্ষমতার বাইরে কোন ধরনের সৃজনশীল কাজ থাকে তার উপর প্রভাব ফেলে।

    লক্ষ্য রাখুন: নির্মাতা এটি প্রকাশ করার পরেও ফলাফলকে ব্যর্থতা হিসেবে উপস্থাপন করেছেন এবং উল্লেখ করেছেন যে তারা এটি শুধুমাত্র YouTube চ্যানেল মান অনুযায়ী বিচার করেছেন, সম্পূর্ণ চলচ্চিত্র বিভাগ হিসেবে নয়; তারা এই ত্রুটিটিকে LLM-এর এজেন্সি বা পরিকল্পনার কাছে নয়, বরং অন্যান্য কারণের কাছে দায়ী করেছেন যা তারা তাদের সম্পূর্ণ নিবন্ধে আলোচনা করেছেন।

What to Watch

আগামী সপ্তাহগুলিতে Flux 3 Image-এর প্রাথমিক অ্যাক্সেস চালু এবং BFL-এর বহুমাত্রিক মডেল উন্নয়ন লক্ষ্য রাখুন, যা ভিডিও, ইমেজ এবং অডিও একসাথে পরিচালনার ক্ষমতা নিয়ে আসবে। একই সাথে, Midjourney-এর নিজস্ব অ্যাপ্লিকেশন তৈরি এবং AI-উত্পাদিত কন্টেন্টের মনোবৈজ্ঞানিক প্রভাব নিয়ে গবেষণার এগিয়ে যাওয়া নজরে রাখুন, কারণ এগুলি ভিডিও প্রযুক্তির ভবিষ্যৎ গঠন করবে।

Sources

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free