AITodayYour daily AI briefing

Video Generation

Jul 29, 2026

Video Generation

The Gist

mimic robotics-এর FLUX-mimic প্রযুক্তি Audi-তে রোবট প্রশিক্ষণের সময় ৩০ ঘণ্টা থেকে মাত্র ৩০ মিনিটে কমিয়ে এনেছে, যখন Black Forest Labs নতুন FLUX 3 মডেল চালু করেছে যা ভিডিও, অডিও এবং রোবটিক্স জুড়ে কাজ করে। Runway ভিডিও AI-এর একটি বাগকে নতুন বৈশিষ্ট্যে রূপান্তরিত করেছে এবং একটি নতুন স্ব-কেন্দ্রিক ভিডিও প্রক্রিয়াকরণ প্ল্যাটফর্ম চালু হয়েছে। তবে গবেষণা দেখাচ্ছে যে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করা সম্ভব হলেও এটি মানুষের বাস্তব ভিডিওতে আস্থা কমিয়ে দিচ্ছে।

Today's Stories

  1. 1

    mimic robotics, Audi-তে FLUX-mimic মোতায়েন করে রোবট প্রশিক্ষণ সময় ৩০ ঘণ্টা থেকে ৩০ মিনিটে নামিয়ে আনল

    কী ঘটেছে: mimic robotics, Black Forest Labs-এর FLUX 3 ভিডিও মডেল দিয়ে তৈরি একটি Video-Action Model FLUX-mimic প্রবর্তন করেছে, যা রোবটগুলিকে মাত্র ৩০ মিনিটের রোবট ডেটা থেকে জটিল হেরফের কাজ শিখতে সক্ষম করে, যার পরিবর্তে ৩০ ঘণ্টা বা তার বেশি সময় লাগত। কোম্পানিটি ইতিমধ্যে অটোমোটিভ উৎপাদনে নমনীয়, সূক্ষ্ম-হেরফেরমূলক কাজ স্বয়ংক্রিয় করতে Audi-র সাথে সিস্টেম মোতায়েন করছে। এটি কেন গুরুত্বপূর্ণ: নমনীয় যন্ত্রাংশ এবং সূক্ষ্ম হেরফেরের সাথে জড়িত উৎপাদন কাজগুলি দশকের রোবোটিক্স বিনিয়োগ সত্ত্বেও ম্যানুয়াল থেকেই গেছে, কারণ প্রচলিত পদ্ধতিতে প্রোগ্রাম করা রোবট ঘরগুলি উৎপাদন ভেরিয়েন্টের জন্য পুনর্প্রকৌশল করতে খুবই ব্যয়বহুল। FLUX-mimic-র ভিডিও বোঝাপড়া থেকে স্থির ছবি থেকে নয়, বরং ভৌত গতিবিদ্যা শিখতে পারার ক্ষমতা Audi-র মতো কারখানাগুলিকে মাসব্যাপী প্রকৌশল প্রচেষ্টা ছাড়াই আগে থেকে অসম্ভব বলে মনে হওয়া কাজগুলি স্বয়ংক্রিয় করতে দেয়, যা স্মার্ট কারখানার Audi-র দৃষ্টিভঙ্গির সাথে সামঞ্জস্যপূর্ণ, যেখানে রোবটগুলি পুনরাবৃত্তিমূলক এবং শারীরিক দৃষ্টিতে দাবিদার কাজে কর্মচারীদের সাথে অংশীদারিত্ব করে।

    নজরে রাখতে হবে: Audi-র উৎপাদন পরিবেশগুলি ইতিমধ্যে নরম-বডি হেরফেরের কাজে FLUX-mimic পরীক্ষা ও মোতায়েন করছে, যা Audi বলে প্রচলিত রোবোটিক্সের সাথে অসম্ভব হত। অংশীদারিত্বটি প্রমাণ করার লক্ষ্য রাখে যে সিস্টেমটি বিস্তৃত সংহতকরণ ব্যয়ভার ছাড়াই বাস্তব উৎপাদন লাইনে অসংগঠিত কাজগুলি নির্ভরযোগ্যভাবে সামলাতে পারে।

  2. 2

    Runwayが動画AIのバグを機能に変身させた

    Runwayは、リアルタイム動画生成中にAI生成アバターが画面外に流れるバグを数週間かけて修正しようとしましたが、最終的にはバグを回避するフロントエンド機能として実装しました。Runway MLのエンタープライズプロダクト責任者Ryan Phillipsは、VB Transform 2026でこの事例を紹介し、基礎モデルを構築していない企業でも、Runwayがモデルをどのように構築・評価・提供しているかを学ぶことが有用だと述べました。 Runwayは一般的な世界モデルを構築する応用AI研究企業で、リアルタイム動画モデル「Runway Characters」でAI生成アバターとのゼロレイテンシ双方向対話を実現しています。5年前にはそのような技術は実現不可能だったとされており、この進展は、技術企業がエンジニアリング上の課題にどう対応するか、実用的な教訓を示しています。

    Phillipsの発言によれば、基礎モデルを自社で構築していない企業であっても、Runwayの設計・評価・製品化の手法から学べる教訓がほぼすべて適用可能だということです。

  3. 3

    আত্মকেন্দ্রিক ভিডিও প্রক্রিয়াকরণ প্ল্যাটফর্ম চালু, ল্যাব অংশীদার খুঁজছে

    কী ঘটেছে: একটি স্টার্টআপ এমন একটি প্ল্যাটফর্ম তৈরি করেছে যা আত্মকেন্দ্রিক এবং স্থানীয় ভিডিওর জন্য ডেটা প্রস্তুতি (ETL) পাইপলাইন স্বয়ংক্রিয় করে, কাঁচা ফুটেজকে রোবোটিক্স এবং ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল উন্নয়নের জন্য মডেল-প্রস্তুত আউটপুটে রূপান্তরিত করে। দলটি গবেষণা ল্যাব এবং কোম্পানিগুলিকে বিনামূল্যে সেবা পরীক্ষা করার জন্য প্রকাশ্যে নিয়োগ করছে। এটি কেন গুরুত্বপূর্ণ: ফিজিক্যাল এআই এবং টেলিঅপারেশন সিস্টেম তৈরিকারী দল বর্তমানে ভিডিও ডেটা প্রি-প্রসেসিং-এ উল্লেখযোগ্য GPU সময় এবং প্রকৌশল প্রচেষ্টা ব্যয় করে—এটি একটি বাধা যা প্ল্যাটফর্মটি দূর করার জন্য ডিজাইন করা হয়েছে। ডেটা পাইপলাইন পরিচালনা আপস্ট্রিমে করে, এটি গণনামূলক সংস্থান এবং প্রকৌশল চক্র মূল মডেল কাজের জন্য মুক্ত করে।

    নজরে রাখার মতো বিষয়: অফারটি প্রতিক্রিয়া প্রদানের জন্য ইচ্ছুক ল্যাবগুলির মধ্যে সীমাবদ্ধ; আগ্রহী দলগুলি অংশগ্রহণ আলোচনা করার জন্য মন্তব্য করতে বা সরাসরি বার্তা পাঠাতে আমন্ত্রিত হয়েছে। কোনো মূল্য নির্ধারণ, উপলব্ধতার তারিখ বা আনুষ্ঠানিক চালু সময়সূচী উল্লেখ করা হয়নি।

  4. 4

    Midjourney অধিগ্রহণ করেছে জ্যোতিষ অ্যাপ Co-Star

    কী ঘটেছে: ছবি এবং ভিডিও জেনারেটরের জন্য পরিচিত এআই ল্যাব Midjourney সোশ্যাল জ্যোতিষ অ্যাপ Co-Star অধিগ্রহণ করেছে। চুক্তির শর্তাবলী প্রকাশ করা হয়নি। Co-Star-এর প্রায় দুই ডজন কর্মচারীর দল Midjourney-তে যোগদান করেছে। এটি গুরুত্বপূর্ণ কেন: Co-Star-এর প্রায় ৪.৩ মিলিয়ন মাসিক সক্রিয় ব্যবহারকারী রয়েছে এবং এটি জ্যোতিষ পূর্বাভাস এবং জ্যোতিষীয় সামঞ্জস্য মূল্যায়ন তৈরি করতে এআই এবং মানুষের লেখা ব্যবহার করে। এই অধিগ্রহণ Midjourney-র মূল ছবি-উৎপাদন ব্যবসার বাইরে ভোক্তা-মুখী অ্যাপ্লিকেশনে সম্প্রসারণের ইঙ্গিত দেয়, যা চিকিৎসা এবং স্পা বিভাগ গড়ে তোলার প্রচেষ্টা অনুসরণ করে।

    লক্ষ্য রাখার বিষয়: Midjourney বর্তমানে প্রাথমিকভাবে Discord-এর মাধ্যমে কাজ করে এবং কোনো স্বতন্ত্র অ্যাপ নেই। Co-Star-এর দলের ভোক্তা অ্যাপ্লিকেশন নির্মাণে অভিজ্ঞতা পরামর্শ দেয় যে Midjourney অবশেষে নিজস্ব স্বতন্ত্র অ্যাপ্লিকেশন বিকাশ করতে পারে।

  5. 5

    Black Forest Labs চালু করেছে FLUX 3 মাল্টিমোডাল মডেল যা ভিডিও, অডিও, রোবটিক্স জুড়ে বিস্তৃত

    কী ঘটেছে: Black Forest Labs ঘোষণা করেছে FLUX 3, একটি একীভূত মাল্টিমোডাল মডেল যা একটি একক আর্কিটেকচারে প্রশিক্ষিত এবং ছবি, ভিডিও, অডিও উৎপাদন এবং অ্যাকশন প্রেডিকশন পরিচালনা করে। কোম্পানি আরও অনাবৃত করেছে FLUX-mimic, একটি ভিডিও-অ্যাকশন রোবটিক্স মডেল যা FLUX 3-এর উপর নির্মিত এবং Audi-এর সাথে একটি একক অন-প্রিমিসেস GPU-তে রিয়েল ফ্যাক্টরি স্থাপনার জন্য পরীক্ষিত। এটি কেন গুরুত্বপূর্ণ: FLUX 3 এমন ক্ষমতা পুনরুৎপাদন এবং প্রসারিত করে যা অন্যান্য অগ্রণী ল্যাব দ্বারা আগে আলাদাভাবে প্রদর্শিত হয়েছিল (Gemini Omni, Grok Imagine, Seedance 2.0), দলটি একটি ওপেন-ওয়েইটস ডেভেলপার সংস্করণ খোলার জন্য প্রতিশ্রুতিবদ্ধ। রোবটিক্স প্রয়োগটি সংকেত দেয় যে ভিডিও বিশ্ব মডেলিং সরাসরি রোবট নিয়ন্ত্রণে স্থানান্তরিত হতে পারে, সম্ভাব্যভাবে বন্ধ ইকোসিস্টেমের উপর নির্ভরতা ছাড়াই প্রতিযোগিতামূলক ওপেন মডেল তৈরিকারী ল্যাবগুলির জন্য বাধা কমাতে পারে।

    যা লক্ষ্য করতে হবে: FLUX 3 Video বর্তমানে প্রাথমিক অ্যাক্সেসে রয়েছে। মডেলটির ছবি, ভিডিও, অডিও এবং রোবটিক্স নিয়ন্ত্রণকে একটি আর্কিটেকচারে একীভূত করার ক্ষমতা—যা যৌথভাবে প্রশিক্ষিত, পৃথক মডিউল হিসাবে নয়—এটি নির্ধারণ করবে যে মাল্টিমোডাল সিস্টেমগুলি শিল্পের মান হয়ে উঠবে নাকি কাজের দ্বারা বিভক্ত থাকবে।

  6. 6

    কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও চিহ্নিত করা থাকলেও বাস্তব ভিডিওতে আস্থা কমায়, গবেষণা বলছে

    কী ঘটেছে: গবেষকরা একশত অংশগ্রহণকারীকে নিয়ে দুই পর্যায়ের গবেষণা পরিচালনা করেছেন। এক গ্রুপকে কৃত্রিম বুদ্ধিমত্তা দ্বারা তৈরি ভিডিও দেখানো হয়েছিল, আরেক নিয়ন্ত্রণ গ্রুপকে মানুষের দ্বারা তৈরি ভিডিও দেখানো হয়েছিল। কৃত্রিম বুদ্ধিমত্তা-এক্সপোজার গ্রুপ তারপর মানুষের দ্বারা তৈরি বিষয়বস্তু দেখেছে এবং পরবর্তী ভিডিওগুলির সত্যতা সম্পর্কে বর্ধিত সন্দেহ, তাদের বিচারের প্রতি আস্থা হ্রাস, উচ্চতর উপলব্ধিগত ব্যাঘাত এবং নিম্নতর সামাজিক সংযোগ রিপোর্ট করেছে—যদিও সংশ্লেষিত বিষয়বস্তু কৃত্রিম বুদ্ধিমত্তা-উত্পাদিত হওয়ার স্পষ্ট প্রকাশ ছিল। কেন এটি গুরুত্বপূর্ণ: গবেষণার ফলাফলগুলি প্রকাশ করে যে কৃত্রিম বুদ্ধিমত্তা-তৈরি ভিডিওগুলি চিহ্নিত করা বাস্তব ভিডিওগুলিতে দর্শকদের আস্থা হ্রাস করা থেকে রক্ষা করে না। এটি প্রস্তাব করে যে বাস্তবসম্মত সংশ্লেষিত বিষয়বস্তু দেখার মনোবৈজ্ঞানিক এবং উপলব্ধিগত প্রভাবগুলি প্রকৃত ফুটেজে স্থানান্তরিত হয়, এমনকি যখন দর্শকরা উৎসটি জানেন। প্ল্যাটফর্ম এবং বিষয়বস্তু নির্মাতাদের জন্য, এটি নির্দেশ এবং প্রকাশের বাইরে কৌশলগুলির প্রয়োজনীয়তা নির্দেশ করে যাতে মানুষ কীভাবে চাক্ষুষ মাধ্যম অনুভব এবং বিশ্বাস করে তা রক্ষা করা যায়।

    যা পর্যবেক্ষণ করতে হবে: গবেষণা তুলে ধরে যে ডিজাইন এবং নীতি পদ্ধতিগুলি অবশ্যই কৃত্রিম বুদ্ধিমত্তা-তৈরি ভিডিও এক্সপোজারের অভিজ্ঞতামূলক এবং মনোবৈজ্ঞানিক প্রভাবগুলি সম্বোধন করতে হবে, শুধুমাত্র নকল থেকে বাস্তবকে আলাদা করার উপর দৃষ্টি নিবদ্ধ করতে হবে না। গবেষণাটি দুই হাজার ছাব্বিশ সালের CHI কম্পিউটিং সিস্টেমে মানব কারণক সম্মেলনে উপস্থাপন করা হয়েছিল।

What to Watch

আগামী দিনগুলিতে আমরা দেখব কীভাবে Audi-এর মতো উৎপাদন কোম্পানিগুলি FLUX-এর মতো ভিডিও প্রযুক্তিকে বাস্তব কারখানার কাজে প্রয়োগ করছে এবং এর মাধ্যমে রোবটিক্স পুনর্সংজ্ঞায়িত করছে। একই সময়ে, FLUX 3 Video এবং অন্যান্য মাল্টিমোডাল সিস্টেমগুলি শিল্প মানদণ্ড হয়ে উঠবে কি না তা নির্ভর করবে এই প্রযুক্তিগুলি নকল-বনাম-বাস্তব সনাক্তকরণের বাইরে মানুষের মনস্তাত্ত্বিক এবং নৈতিক চিন্তাভাবনাগুলিকে কতটা সফলভাবে সামলাতে পারে তার উপর।

Sources

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free