ابزار بازمتن ElevenLabs: تولید افکتهای صوتی هوشمند برای ویدیوها با قدرت GPT-۴o
استارتاپ پیشرو در حوزه هوش مصنوعی ElevenLabs، تنها چند هفته پس از معرفی مدل قدرتمند تبدیل متن به صدا تحت عنوان Sound Effects، گامی فراتر برداشته و یک ابزار متنباز (Open Source) را برای جامعه توسعهدهندگان و سازندگان محتوا رونمایی کرد. این نوآوری امکان تحلیل بصری وولیدز و تولید افکتهای صوتی متناسب را به صورت خودکار فراهم میآورد.
مکانیزم کارکرد هوش مصنوعی تولید صدا در ElevenLabs
بر اساس گزارشهای منتشر شده، روند پردازش در این ابزار به صورت زیر است: با آپلود یک ویدیو بدون صدا، سیستم به طور خودکار از فریمهای بصری در فواصل زمانی یک ثانیهای نمونهبرداری میکند (مجموعاً چهار فریم). این فریمها به همراه یک پرامپت اولیه به مدل پیشرفته GPT-4o ارسال شده تا توصیفهای دقیق و کانتکستمحور برای هر sahne استخراج گردد. در مرحله نهایی، این پرامپتهای بهینه شده از طریق API Sound Effects برای синтеز افکتهای صوتی مناسب استفاده میشوند.
🔗 بیشتر بخوانید: سوالهایی که بی جواب ماندهاند
[[OAR_MEDIA_1]]
خروجی نهایی، یک فایل ویدیویی ادغام شده با افکتهای صوتی تولیدی است که برای دانلود در اختیار کاربر قرار میگیرد. نکته مهم، محدودیت زمان جاری این ابزار است؛ در حال حاضر حداکثر طول ویدیوهای قابل پردازش ۲۲ ثانیه میباشد.
سادگی فرآیند و پتانسیلهای آینده
استفاده از این تکنولوژی پیچیدگی فنی خاصی ندارد: کاربر تنها نیاز دارد فایل ویدیوی خام (بدون صدا) را آپلود کند تا هوش مصنوعی ElevenLabs چهار вариант مختلف با طراحی صدا ارائه دهد. کارشناسان پیشبینی میکنند که در آینده نزدیک، این قابلیت در پلتفرمهای بزرگتر تولید محتوا و استودیوهای ویرایش ویدیو ادغام شده تا جریان کار (Workflow) سازندگان را به شدت تسریع نماید.
🔗 بیشتر بخوانید: توافق تاریخی گوگل با قانونگذاران کالیفرنیا: سرمایهگذاری ۱۲۲.۵ میلیون دلاری برای نجات خبرنگاری محلی
[[OAR_MEDIA_2]]
«سازندگان ویدیوهای هوش مصنوعی به شدت در جستجوی لایههای صوتی باکیفیت و متناسب هستند. ما با درک بصری از فریمهای ویدیو و ارائه بهترین خروجی صوتی، میتوانیم سرعت و کیفیت روند تولید محتوای آنها را به طور قابل توجهی ارتقا دهیم.»
— عمار ریشی، مدیر طراحی محصول ElevenLabs
ریشی همچنین یک نمونه ویدیوی عملیاتی را به اشتراک گذاشته که در ساخت آن از teknولوژی ElevenLabs در ترکیب با موتورهای تصویری Luma AI و Hedra بهره برده شده است.
دسترسی به کد منبع و دمو آنلاین
توسعهدهندگان علاقهمند میتوانند به مخزن کد منبع این پروژه در GitHub مراجعه کنند.، ElevenLabs یک وبسایت اختصاصی با آدرس VideoToSoundEffects.com راهاندازی کرده تا کاربران بتوانند قابلیتهای Sound Effects API را به صورت تعاملی و بدون نیاز به کدنویسی تست نمایند.