سالهاست که گوگل درباره هوش مصنوعی چندوجهی (Multimodal) صحبت میکند؛ ترکیبی از متن، تصویر، صوت، ویدیو، کد و جستجو که همه در یک مدار مشترک به هم وصل میشوند. معرفی «جیمنی اومنی» (Gemini Omni) در گوگل آئی/او ۲۰۲۶، گامی طبیعی اما جسورانه به نظر میرسد. این خانواده جدید از مدلهای گوگل، هدفی فراتر از یک چتبات معمولی را دنبال میکند: آنها در تلاشاند تا جریانهای کاری خلاقانهای که تاکنون مجزا بودند، را در یک مدل واحد ادغام کنند.
جیمنی اومنی دقیقاً چیست؟
به زبان ساده، جیمنی اومنی جایی است که توان استدلال گوگل با توانایی خلق محتوا تلاقی پیدا میکند. این مدل میتواند ورودیهای مختلفی مانند متن، تصویر، صدا و ویدیو را دریافت کرده و بر اساس آنها ویدیو تولید یا ویرایش کند. نکته کلیدی اینجاست که اومنی فقط روی «تولید از صفر» متمرکز نیست، بلکه «ویرایش از طریق مکالمه» را هم هدف قرار داده است. شما میتوانید یک ویدیوی خام را به همراه یک تصویر مرجع و یک دستورالعمل متنی به مدل بدهید و از آن بخواهید ویدیویی جدید بسازد که حرکات اولیه را حفظ کند، استایل تصویر را داشته باشد و بخشهای خاصی را تغییر دهد.
ویژگیهای برجسته مدل اولیه: جیمنی اومنی فلش
- ویرایش گفتاری ویدیو: به جای کار با تایملاینهای پیچیده نرمافزارهای ادیتور، شما با استفاده از دستورات زبان طبیعی (مثلاً «نور اتاق را کم کن» یا «آویون را نامرئی کن») تغییرات اعمال میکنید. مدل میتواند دستورات پیشین را به خاطر بسپارد و ویرایشها را به صورت تدریجی انجام دهد.
- ترکیب چند مرجع: امکان استفاده همزمان از تصویر شخصیت، مرجع استایل، ویدیو موجود و فایل صوتی برای تولید یک خروجی یکپارچه.
- درک فیزیک و حرکت: اومنی طراحی شده است تا قوانین فیزیک مثل جاذبه، اینرسی و پیوستگی صحنه را بهتر از نسلهای قبل درک کند تا از ناهماهنگیهای بصری جلوگیری شود.
تفاوت جیمنی اومنی با مدلهای نسل قبل
مهمترین تفاوت اومنی با مدلهای صرف ویدیوسازی مثل «ویو» (Veo) در رویکرد آن است. ویو بیشتر یک تولیدکننده ویدیو محسوب میشود، اما اومنی یک مدل چندوجهی است که ترکیبی از استدلال خلاقانه و ویرایش رسانهای را ارائه میدهد. گوگل قصد دارد در آینده این مدلها را برای خروجیهای تصویر و صدا نیز گسترش دهد. این به این معناست که آینده ابزارهای هوش مصنوعی خلاقانه، کمتر شبیه به «دستگاه قمار» (که نتیجه را نمیدانید) و بیشتر شبیه یک «سیستم خلاقانه قابل ویرایش» خواهد بود که میتوان آن را مدیریت کرد.
کاربردهای عملی فراتر از سرگرمی
اومنی فقط برای ساختن ویدیوهای عجیب و غریب نیست. با قابلیت ساخت «توضیحدهندههای بصری» (Explainers)، معلمان، بازاریابها و تیمهای محصول میتوانند ایدههای پیچیده را با چند دستور ساده به تصاویر متحرک و قابل ویرایش تبدیل کنند. همچنین با قابلیت آواتارهای شخصی، کاربران میتوانند نسخه دیجیتالی از خود را بسازند و با صدای خودشان در ویدیوها صحبت کنند. البته گوگل با استفاده از واترمارک SynthID و اعتبارسنجی محتوای C2PA، سعی کرده تا میزان سوءاستفاده و جعل هویت را کاهش دهد.
کجا و چگونه در دسترس است؟
نسخه اولیه، «جیمنی اومنی فلش»، از طریق اپلیکیشنهای Gemini، Google Flow و حتی YouTube Shorts Remix در دسترس قرار گرفته است. در حال حاضر این ابزار برای مشترکین پلنهای خاص گوگل فعال است و دسترسی رایگان محدودی برای ویدیوهای کوتاه یوتیوب (برای افراد بالای ۱۸ سال) ارائه شده است. دسترسی به API برای توسعهدهندگان حرفهای در هفتههای آینده آغاز خواهد شد.
نظر شما درباره تغییر پارادایم ویرایش ویدیو با هوش مصنوعی چیست؟ آیا به نظرتان ابزارهایی که اجازه «گفتگو با ویدیو» را بدهند، جایگزین نرمافزارهای سنتی ادیتینگ خواهند شد؟



