
هوش مصنوعی جدید متا، جدیدترین محصول آزمایشگاه هوش مصنوعی فوقهوشمند متا (MSI) است.
متا نخستین مدل صوتی بلادرنگ خود با نام Muse Voice Transcribe را معرفی کرده است. به گفته متا، هوش مصنوعی جدید متا میتواند برای بیش از ۲۰ گوینده، گفتار را به متن تبدیل کند و همچنین بهصورت روان و همزمان، چندین زبان مختلف را مدیریت کند.
مدیرعامل متا، مارک زاکربرگ، که اخیراً پس از سه سال فعالیت نکردن در شبکه اجتماعی X دوباره به این پلتفرم بازگشته است، نمونهای از توانایی این هوش مصنوعی جدید متا در مدیریت همزمان چند گوینده و زبان مختلف را به اشتراک گذاشت.
در این ویدیو، مدل رونویسی میتواند بهصورت خودکار گویندگان مختلف را از یکدیگر تشخیص دهد و هنگام تغییر زبان، زبان جدید را شناسایی و با آن تطبیق دهد. این مدل حتی قادر است پدیدهای به نام تغییر کد زبانی (Code-Switching) را نیز تشخیص دهد و جملاتی را که در آنها از واژههای چند زبان مختلف استفاده شده است، به متن تبدیل کند.
او توضیح داد: «این مدل هوش مصنوعی جدید متا خودش تصمیم میگیرد چه زمانی به صدا گوش دهد. هنگام مواجهه با کلمات دشوار، کمی بیشتر منتظر میماند و برای کلمات ساده سریعتر نتیجه را ثبت میکند. این مدل با استفاده از تأخیر تطبیقی (Adaptive Delay)، هر توکن را پیشبینی میکند تا دقت رونویسی افزایش یابد.
او افزود: «Muse Voice Transcribe حتی در مواجهه با صدای واقعی و نامنظم نیز عملکرد خوبی دارد. این مدل با بیش از ۷۰ زبان آموزش دیده که ۲۵ زبان آن در زمان عرضه بهطور کامل اعتبارسنجی شدهاند. همچنین میتواند تغییر زبان در میانه جمله (Code-Switching) را تشخیص دهد و جلسات صوتی یکساعته با حضور بیش از ۲۰ گوینده را مدیریت کند.
عرضه مدل هوش مصنوعی جدید متا کمتر از یک هفته پس از معرفی Google Gemini 3.5 Transcribe انجام شده است؛ مدلی صوتی از گوگل که قابلیتهای مشابهی دارد. با این حال، در حالی که گوگل قصد دارد مدل صوتی خود را در اندروید و در نهایت Chrome ادغام کند، هنوز مشخص نیست که متا برنامهای برای استفاده از Muse Voice Transcribe در سرویسهای اصلی و پرکاربرد خود دارد یا خیر.
با این حال، در حال حاضر کاربران میتوانند قابلیتهای حالت جدید را در اپلیکیشن Meta AI برای مک که متا اخیراً منتشر کرده است، تجربه کنند. از آنجا که این اپلیکیشن میتواند قابلیتهای صوتی را در سایر برنامهها فعال کند، Muse Voice Transcribe نیز از این پس قابلیتهای دیکته صوتی را در سرویسهای دیگر تأمین خواهد کرد.
هوش مصنوعی جدید متا همچنین از طریق Muse Code و Model API متا در اختیار توسعهدهندگان قرار گرفته است. هزینه استفاده از آن ۳ دلار به ازای هر هزار دقیقه صوت تعیین شده است. علاوه بر این، نسخهای آزمایشی از Muse Transcribe نیز در وبلاگ تحقیقاتی متا در دسترس قرار دارد.
Muse Voice Transcribe جدیدترین محصول آزمایشگاه Meta Superintelligence Lab (MSI) است؛ آزمایشگاهی که در هفتههای اخیر بهطور مداوم مدلها و ابزارهای جدید هوش مصنوعی معرفی کرده است. متا طی چند هفته گذشته همچنین نخستین ایجنت اختصاصی کدنویسی، یک مدل Open-Weight و اپلیکیشن Meta AI برای مک را معرفی کرده است.
منبع
با ثبت نظر خود درباره هوش مصنوعی جدید متا؛ تشخیص همزمان چند گوینده و زبان به راهنمایی دیگران بالا بردن کیفیت مطالب کمک کنید.