AITodayYour daily AI briefing

Video Generation

Jul 28, 2026

Video Generation

The Gist

আজকের ভিডিও জেনারেশন খবরে Black Forest Labs তাদের নতুন FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স সাপোর্ট করে, যখন Midjourney Co-Star অধিগ্রহণ করেছে এবং AI ভিডিও প্রযুক্তিতে নতুন সম্ভাবনা তৈরি করছে। একই সময়ে গবেষণায় দেখা গেছে যে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করার প্রযুক্তি থাকলেও মানুষ বাস্তব ভিডিওর প্রতি আস্থা হারাচ্ছে, যা এই প্রযুক্তির নৈতিক দিক তুলে ধরে।

Today's Stories

  1. 1

    Runwayのバグ、新機能に変身 AI動画モデルの工学的教訓

    Runwayは、リアルタイム動画生成でAI生成アバターが画面中央からずれるバグを数週間かけて修正しようとしていました。しかし最終的には、バックエンド修正ではなく、フロントエンドでこの問題を回避する新機能として実装することで対応しました。 Runway MLのエンタープライズ製品責任者Ryan Phillipsは、VB Transform 2026でこの事例を紹介し、基盤モデルを自社開発していない企業でも、Runwayの構築・評価・リリースのアプローチから学べることが多いと述べました。これはAI企業だけでなく、広く組織がAIツールを開発・運用する際の実践的教訓を示しています。

    Runway Charactersはリアルタイム動画モデルで、AI生成アバターとのゼロレイテンシー双方向インタラクションを可能にしています。

  2. 2

    ইগোসেন্ট্রিক ভিডিও প্রসেসিং প্ল্যাটফর্ম চালু হয়েছে, ল্যাব পার্টনার খুঁজছে

    কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা ইগোসেন্ট্রিক এবং স্পেশাল ভিডিওর জন্য ডেটা প্রিপারেশন (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ডেভেলপমেন্টের জন্য মডেল-রেডি আউটপুটে রূপান্তরিত করে। দল গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য খোলাভাবে নিয়োগ দিচ্ছে। এটি কেন গুরুত্বপূর্ণ: ফিজিক্যাল AI এবং টেলিঅপারেশন সিস্টেম তৈরি করা টিমগুলি বর্তমানে ভিডিও ডেটা প্রিপ্রসেসিংয়ে উল্লেখযোগ্য GPU সময় এবং ইঞ্জিনিয়ারিং প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। আপস্ট্রিমে ডেটা পরিচালনা সামলিয়ে, এটি কম্পিউটেশনাল সম্পদ এবং ইঞ্জিনিয়ারিং চক্র মূল মডেল কাজের জন্য মুক্ত করে।

    কী দেখতে হবে: অফারটি প্রতিক্রিয়া প্রদান করতে ইচ্ছুক ল্যাবগুলির জন্য সীমাবদ্ধ; আগ্রহী টিমগুলিকে অংশগ্রহণ নিয়ে আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রণ জানানো হয়েছে। কোনো মূল্য নির্ধারণ, প্রাপ্যতার তারিখ বা আনুষ্ঠানিক লঞ্চের সময়সীমা উল্লেখ করা হয়নি।

  3. 3

    Midjourney এর Co-Star অধিগ্রহণ

    কী ঘটেছে: ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত AI ল্যাব Midjourney সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star এর প্রায় দুই ডজন কর্মচারীর দল Midjourney এ যোগ দিয়েছে। এটি গুরুত্বপূর্ণ কেন: Co-Star এর প্রায় ৪.৩ মিলিয়ন মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি জ্যোতিষ পূর্বাভাস এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে AI এবং মানব লেখা ব্যবহার করে। এই অধিগ্রহণটি Midjourney এর মূল ছবি-জেনারেশন ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপ্লিকেশনে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ তৈরির প্রচেষ্টা অনুসরণ করে।

    যা লক্ষ্য রাখতে হবে: Midjourney বর্তমানে প্রধানত Discord এর মাধ্যমে কাজ করে এবং কোনো স্বাধীন অ্যাপ নেই। Co-Star এর দলের ভোক্তা অ্যাপ তৈরির অভিজ্ঞতা পরামর্শ দেয় যে Midjourney অবশেষে তার নিজস্ব স্বাধীন অ্যাপ্লিকেশন তৈরি করতে পারে।

  4. 4

    Black Forest Labs FLUX 3 মাল্টিমোডাল মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবোটিক্স সমর্থন করে

    কী ঘটেছে: Black Forest Labs FLUX 3 ঘোষণা করেছে, এটি একটি একীভূত মাল্টিমোডাল মডেল যা একক স্থাপত্যে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও জেনারেশন এবং অ্যাকশন প্রেডিকশন পরিচালনা করে। কোম্পানিটি FLUX-mimic ও উন্মোচন করেছে, যা FLUX 3 এর উপর নির্মিত একটি ভিডিও-অ্যাকশন রোবোটিক্স মডেল এবং Audi এর সাথে পরীক্ষা করা হয়েছে একটি একক অন-প্রিমাইসেস GPU তে বাস্তব কারখানা স্থাপনার জন্য। কেন এটি গুরুত্বপূর্ণ: FLUX 3 পূর্বে অন্যান্য অগ্রগামী ল্যাবস (Gemini Omni, Grok Imagine, Seedance 2.0) দ্বারা আলাদাভাবে প্রদর্শিত ক্ষমতা পুনরুৎপাদন এবং সম্প্রসারণ করে, দলটি একটি ওপেন-ওয়েট ডেভেলপার সংস্করণ খোলার প্রতিশ্রুতিবদ্ধ। রোবোটিক্স প্রয়োগটি ইঙ্গিত করে যে ভিডিও ওয়ার্ল্ড মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভাব্যভাবে বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরি করা ল্যাবসের জন্য বাধা কমায়।

    লক্ষ্য রাখতে হবে: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। মডেলটির একটি স্থাপত্যে ছবি, ভিডিও, অডিও এবং রোবোটিক্স নিয়ন্ত্রণ একীভূত করার ক্ষমতা—যৌথভাবে প্রশিক্ষিত পৃথক মডিউল হিসাবে নয়—এটি আকার দেবে যে মাল্টিমোডাল সিস্টেম শিল্প মান হয়ে উঠবে নাকি কাজ দ্বারা খণ্ডিত থাকবে।

  5. 5

    কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করা থাকলেও বাস্তব ভিডিওর প্রতি আস্থা কমায়, গবেষণায় দেখা গেছে

    কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীর সাথে দুই পর্যায়ের একটি গবেষণা পরিচালনা করেছেন যেখানে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও দেখা গ্রুপকে মানুষের তৈরি ভিডিও দেখা নিয়ন্ত্রণ গ্রুপের সাথে তুলনা করা হয়েছে। কৃত্রিম বুদ্ধিমত্তা এক্সপোজার গ্রুপ পরবর্তীতে মানুষের তৈরি কন্টেন্ট দেখেছে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে অধিক সন্দেহ প্রকাশ করেছে, তাদের বিচারে আস্থা হ্রাস পেয়েছে, উচ্চতর উপলব্ধিগত বিঘ্ন এবং নিম্নতর সামাজিক সংযোগ অনুভব করেছে—যদিও কৃত্রিম সামগ্রীটি কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি তা স্পষ্টভাবে প্রকাশ করা হয়েছিল। কেন এটি গুরুত্বপূর্ণ: গবেষণাফল প্রকাশ করে যে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিওগুলি লেবেল করা বাস্তব ভিডিওর প্রতি দর্শকদের আস্থা ভেঙে দেওয়া থেকে বিরত করে না। এটি পরামর্শ দেয় যে বাস্তবসম্মত সিন্থেটিক কন্টেন্ট দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিগত প্রভাব প্রকৃত ফুটেজে ছড়িয়ে পড়ে, এমনকি যখন দর্শকরা উৎস সম্পর্কে জানেন। প্ল্যাটফর্ম এবং কন্টেন্ট নির্মাতাদের জন্য, এটি মানুষ কীভাবে ভিজ্যুয়াল মিডিয়া অনুভব করে এবং বিশ্বাস করে তা রক্ষা করার জন্য সনাক্তকরণ এবং প্রকাশের বাইরে কৌশলের প্রয়োজনীয়তা নির্দেশ করে।

    কী লক্ষ্য রাখতে হবে: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সমাধান করতে হবে, শুধু জাল এবং বাস্তবকে আলাদা করার দিকে ফোকাস করা নয়। গবেষণাটি কম্পিউটিং সিস্টেমে মানব কারণ বিষয়ক ২০২৬ CHI সম্মেলনে উপস্থাপন করা হয়েছিল।

  6. 6

    Black Forest Labs Flux 3 প্রকাশ করেছে নেটিভ অডিও ভিডিও জেনারেশনের সাথে

    কী ঘটল: জার্মান এআই কোম্পানি Black Forest Labs Flux 3 প্রকাশ করেছে, একটি মাল্টিমোডাল ফাউন্ডেশন মডেল যা ছবি, ভিডিও এবং অডিও একসাথে শিখে। মডেলটি প্রথমবারের মতো বিশ সেকেন্ড পর্যন্ত নেটিভ অডিও সহ ভিডিও তৈরি করতে পারে, টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, ভিডিও-টু-ভিডিও, কীফ্রেম-ভিত্তিক ট্রানজিশন, বহুভাষিক সংলাপ এবং ক্লিপের মধ্যে এজেন্ট-চালিত লিঙ্ক সমর্থন করে। এটি কেন গুরুত্বপূর্ণ: দশ সেকেন্ডের ক্লিপে ৭২০পি-তে প্রাথমিক মূল্যায়ন ব্যবহার করে, Flux 3 একাধিক প্রতিদ্বন্দ্বীর উপর পছন্দের দিক থেকে এগিয়ে ছিল — Luma Ray 3.2-এর ৯৩ শতাংশ, Runway Gen-4.5-এর ৭৭ শতাংশ এবং Grok Imagine Video-এর ৬৯ শতাংশ। শক্তিশালী প্রতিযোগীদের বিরুদ্ধে, এটি Seedance 2.0 এবং Gemini Omni Flash-এর সাথে মিলেছে বা কাছাকাছি ছিল (উভয়েই ৫২ শতাংশ পছন্দ), যারা ইতিমধ্যে বড় প্রোডাকশন ওয়ার্কফ্লো পরিচালনা করছে। BFL আরও Flux-mimic তৈরি করেছে, একটি ভিডিও-অ্যাকশন মডেল যা Audi-তে প্রোডাকশন কাজে পরীক্ষা করা হচ্ছে, যা আর্কিটেকচার রোবোটিক্স অ্যাপ্লিকেশনে সম্প্রসারিত হওয়ার পরামর্শ দেয়।

    লক্ষ্য রাখার বিষয়: Flux 3 Image আগামী কয়েক সপ্তাহের মধ্যে প্রাথমিক অ্যাক্সেসে চালু হতে চলেছে, জটিল প্রম্পট এবং বহুভাষিক পাঠ্য রেন্ডারিংয়ে উন্নতি সহ। অ্যাকশন প্রেডিকশন প্রাথমিকভাবে নির্বাচিত অংশীদারদের মাধ্যমে অফার করা হবে। BFL 'Flux 3 Dev' নামে মাল্টিমোডাল ব্যাকবোনে ওপেন-ওয়েট অ্যাক্সেস দেওয়ার পরিকল্পনা করছে, দীর্ঘমেয়াদী কাজের সাথে উপলব্ধি, অ্যাকশন এবং ভাষা পূর্বাভাস একত্রিত করে একটি একক মডেল তৈরিতে।

What to Watch

আগামী সপ্তাহগুলিতে Runway Characters-এর মতো রিয়েল-টাইম ভিডিও মডেল এবং FLUX 3-এর মাল্টিমোডাল ক্ষমতাগুলি কীভাবে বাস্তব জগতে কাজ করে তা দেখুন, বিশেষ করে যখন Midjourney সম্ভাব্যভাবে Discord-এর বাইরে যায় এবং BFL খোলা অ্যাক্সেস প্রদান করে। একই সাথে, মনোযোগ দিন যে গবেষকরা এআই-উৎপাদিত ভিডিওর মানসিক প্রভাব কীভাবে সম্বোধন করতে হবে তা নিয়ে কাজ করছেন—কারণ এই প্রযুক্তিগুলি আরও শক্তিশালী হওয়ার সাথে সাথে, শুধুমাত্র সত্য এবং মিথ্যা আলাদা করা যথেষ্ট নয়।

Sources

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free