هوش مصنوعی جدید متا
اخبار، اپل

هوش مصنوعی جدید متا؛ تشخیص هم‌زمان چند گوینده و زبان

12 شهریور 1405
بدون دیدگاه

هوش مصنوعی جدید متا، جدیدترین محصول آزمایشگاه هوش مصنوعی فوق‌هوشمند متا (MSI) است.

متا نخستین مدل صوتی بلادرنگ خود با نام Muse Voice Transcribe را معرفی کرده است. به گفته متا، هوش مصنوعی جدید متا می‌تواند برای بیش از ۲۰ گوینده، گفتار را به متن تبدیل کند و همچنین به‌صورت روان و هم‌زمان، چندین زبان مختلف را مدیریت کند.

مدیرعامل متا، مارک زاکربرگ، که اخیراً پس از سه سال فعالیت نکردن در شبکه اجتماعی X دوباره به این پلتفرم بازگشته است، نمونه‌ای از توانایی این هوش مصنوعی جدید متا در مدیریت هم‌زمان چند گوینده و زبان مختلف را به اشتراک گذاشت.

در این ویدیو، مدل رونویسی می‌تواند به‌صورت خودکار گویندگان مختلف را از یکدیگر تشخیص دهد و هنگام تغییر زبان، زبان جدید را شناسایی و با آن تطبیق دهد. این مدل حتی قادر است پدیده‌ای به نام تغییر کد زبانی (Code-Switching) را نیز تشخیص دهد و جملاتی را که در آن‌ها از واژه‌های چند زبان مختلف استفاده شده است، به متن تبدیل کند.

او توضیح داد: «این مدل هوش مصنوعی جدید متا خودش تصمیم می‌گیرد چه زمانی به صدا گوش دهد. هنگام مواجهه با کلمات دشوار، کمی بیشتر منتظر می‌ماند و برای کلمات ساده سریع‌تر نتیجه را ثبت می‌کند. این مدل با استفاده از تأخیر تطبیقی (Adaptive Delay)، هر توکن را پیش‌بینی می‌کند تا دقت رونویسی افزایش یابد.

او افزود: «Muse Voice Transcribe حتی در مواجهه با صدای واقعی و نامنظم نیز عملکرد خوبی دارد. این مدل با بیش از ۷۰ زبان آموزش دیده که ۲۵ زبان آن در زمان عرضه به‌طور کامل اعتبارسنجی شده‌اند. همچنین می‌تواند تغییر زبان در میانه جمله (Code-Switching) را تشخیص دهد و جلسات صوتی یک‌ساعته با حضور بیش از ۲۰ گوینده را مدیریت کند.

عرضه مدل هوش مصنوعی جدید متا کمتر از یک هفته پس از معرفی Google Gemini 3.5 Transcribe انجام شده است؛ مدلی صوتی از گوگل که قابلیت‌های مشابهی دارد. با این حال، در حالی که گوگل قصد دارد مدل صوتی خود را در اندروید و در نهایت Chrome ادغام کند، هنوز مشخص نیست که متا برنامه‌ای برای استفاده از Muse Voice Transcribe در سرویس‌های اصلی و پرکاربرد خود دارد یا خیر.

با این حال، در حال حاضر کاربران می‌توانند قابلیت‌های حالت جدید را در اپلیکیشن Meta AI برای مک که متا اخیراً منتشر کرده است، تجربه کنند. از آنجا که این اپلیکیشن می‌تواند قابلیت‌های صوتی را در سایر برنامه‌ها فعال کند، Muse Voice Transcribe نیز از این پس قابلیت‌های دیکته صوتی را در سرویس‌های دیگر تأمین خواهد کرد.

هوش مصنوعی جدید متا همچنین از طریق Muse Code و Model API متا در اختیار توسعه‌دهندگان قرار گرفته است. هزینه استفاده از آن ۳ دلار به ازای هر هزار دقیقه صوت تعیین شده است. علاوه بر این، نسخه‌ای آزمایشی از Muse Transcribe نیز در وبلاگ تحقیقاتی متا در دسترس قرار دارد.

Muse Voice Transcribe جدیدترین محصول آزمایشگاه Meta Superintelligence Lab (MSI) است؛ آزمایشگاهی که در هفته‌های اخیر به‌طور مداوم مدل‌ها و ابزارهای جدید هوش مصنوعی معرفی کرده است. متا طی چند هفته گذشته همچنین نخستین ایجنت اختصاصی کدنویسی، یک مدل Open-Weight و اپلیکیشن Meta AI برای مک را معرفی کرده است.

منبع

engadget

نظر خود را بنویسید

با ثبت نظر خود درباره هوش مصنوعی جدید متا؛ تشخیص هم‌زمان چند گوینده و زبان به راهنمایی دیگران بالا بردن کیفیت مطالب کمک کنید.