بهار فناوری

متا مدل جدیدی برای رونویسی لحظه‌ای صدا با نام Muse Voice Transcribe معرفی کرد که به گفته این شرکت می‌تواند گفتار بیش از ۲۰ گوینده را تشخیص دهد و هم‌زمان با چند زبان کار کند. این مدل همچنین می‌تواند هنگام تغییر زبان در میانه جمله، زبان‌های مختلف را تشخیص دهد و متن را بر همان اساس رونویسی کند.

Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ متا است و برای تبدیل گفتار به متن در حالت استریم طراحی شده است. این مدل قابلیت‌هایی مانند تفکیک گویندگان و تشخیص زمان پایان گفتار را در یک مدل واحد ارائه می‌کند.

مدل تبدیل گفتار به متن متا: Muse Voice Transcribe

«مارک زاکربرگ»، مدیرعامل متا، نمونه‌ای از عملکرد این مدل را در شبکه اجتماعی ایکس منتشر کرده است. در این ویدیو، سیستم می‌تواند چند گوینده را از یکدیگر تشخیص دهد و هنگام صحبت‌کردن افراد به زبان‌های مختلف، زبان گفتار را به‌صورت خودکار تغییر دهد.

این مدل همچنین از قابلیتی موسوم به تغییر زبانی پشتیبانی می‌کند؛ به این معنا که اگر فردی در یک جمله از واژه‌های چند زبان استفاده کند، سیستم می‌تواند این تغییر را تشخیص دهد و جمله را رونویسی کند.

زاکربرگ درباره نحوه عملکرد مدل توضیح داده است: «مدل تصمیم می‌گیرد چه زمانی گوش بدهد. برای واژه‌های دشوار کمی بیشتر صبر می‌کند و برای واژه‌های ساده سریع‌تر نتیجه را ثبت می‌کند.» به گفته او، این فرایند با استفاده از تأخیر تطبیقی انجام می‌شود تا مدل بتواند توکن بعدی را پیش‌بینی و دقت رونویسی را افزایش دهد.

زاکربرگ همچنین گفته است مدل برای کار با صدای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان آموزش داده شده است. به گفته او، Muse Voice Transcribe می‌تواند جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از معرفی مدل صوتی Gemini 3.5 Transcribe گوگل انجام داده است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامه‌ای برای استفاده از Muse Voice Transcribe در سرویس‌های اصلی خود دارد.

درحال‌حاضر، کاربران می‌توانند قابلیت‌های این مدل را در اپلیکیشن دسکتاپ Meta AI برای مک تجربه کنند. این مدل برای توسعه‌دهندگان نیز از طریق Muse Code و Model API متا در دسترس است. هزینه استفاده از API برابر با ۳ دلار به ازای هر هزار دقیقه صوت اعلام شده است.

ارسال دیدگاه

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

11 − نه =