تاریخ انتشار : پنج‌شنبه 3 سپتامبر 2026 - 3:37 خبرنگار : داود کنعانی
کد خبر : 16293

میوز ویس ترنسکرایب متا چگونه کار می‌کند؟

میوز ویس ترنسکرایب متا چگونه کار می‌کند؟
شرکت متا مدل جدید خود را برای رونویسی هم‌زمان مکالمات صوتی معرفی کرده است؛ مدلی که برخلاف ابزارهای ساده تبدیل گفتار به متن، می‌تواند ساختار یک گفت‌وگوی چندنفره را نیز تشخیص دهد.

به گزارش تجارگستران ؛ متا از مدل هوش مصنوعی جدیدی با نام «میوز ویس ترنسکرایب» رونمایی کرده است که می‌تواند گفت‌وگوهای چندنفره را به‌صورت بلادرنگ به متن تبدیل کند. این مدل علاوه بر تشخیص بیش از ۲۰ گوینده، توانایی شناسایی زبان‌های مختلف در یک جریان صوتی را نیز دارد.

هوش مصنوعی متا مکالمات چندنفره را زنده به متن تبدیل می‌کند

«میوز ویس ترنسکرایب» نخستین مدل صوتی بلادرنگ آزمایشگاه ابرهوش متا محسوب می‌شود و قادر است در جریان یک مکالمه، صحبت افراد مختلف را از یکدیگر تفکیک کند.

یکی از قابلیت‌های اصلی این مدل، تشخیص گوینده است. متا اعلام کرده که مدل جدید می‌تواند بیش از ۲۰ نفر را در یک مکالمه مدیریت کند و مشخص کند هر بخش از متن به کدام گوینده مربوط است.

پشتیبانی هم‌زمان از چند زبان

میوز ویس ترنسکرایب تنها به شناسایی گویندگان محدود نیست و می‌تواند تغییر زبان در جریان یک گفت‌وگو را نیز مدیریت کند.

برای مثال، اگر افراد حاضر در یک جلسه از زبان‌های مختلف استفاده کنند، مدل می‌تواند تغییر زبان را در فرایند رونویسی تشخیص دهد. این ویژگی برای جلسات چندزبانه، مصاحبه‌ها و گفت‌وگوهای گروهی کاربرد دارد.

قابلیت عملکرد میوز ویس ترنسکرایب
تبدیل گفتار به متن به‌صورت بلادرنگ
تشخیص گوینده تفکیک بیش از ۲۰ گوینده
تشخیص زبان پشتیبانی از زبان‌های مختلف در یک جریان صوتی
تشخیص پایان گفتار به‌صورت بومی در مدل
پردازش صوت در قالب یک مدل واحد
کاربرد فعلی دیکته صوتی در اپلیکیشن مک متا

چند قابلیت صوتی در یک مدل واحد

متا اعلام کرده است که تشخیص گوینده، تشخیص پایان بخش‌های گفتار و تبدیل صوت به متن در این مدل به‌صورت بومی انجام می‌شود.

ترکیب این قابلیت‌ها در یک مدل واحد می‌تواند نیاز به استفاده هم‌زمان از چند سامانه جداگانه برای پردازش یک مکالمه را کاهش دهد. در نتیجه، فرایند تبدیل گفت‌وگوی صوتی به متن با ساختار یکپارچه‌تری انجام می‌شود.

استفاده از مدل در اپلیکیشن مک متا

این فناوری هم‌زمان با معرفی، در قابلیت دیکته صوتی اپلیکیشن مک متا نیز مورد استفاده قرار گرفته است. کاربران در این بخش می‌توانند صحبت کنند و محتوای صوتی آنها به متن تبدیل شود.

با وجود آغاز استفاده از مدل در این قابلیت، متا هنوز درباره ادغام گسترده‌تر میوز ویس ترنسکرایب در سایر محصولات و سرویس‌های خود جزئیات بیشتری اعلام نکرده است.

رقابت متا و گوگل در مدل‌های صوتی

معرفی مدل جدید متا در شرایطی انجام شده که شرکت‌های فناوری روی توسعه مدل‌هایی برای درک سریع‌تر و دقیق‌تر گفت‌وگوهای صوتی تمرکز کرده‌اند.

گوگل نیز چند روز پیش از یک مدل صوتی جدید رونمایی کرده بود که قابلیت‌هایی از جمله پردازش صوت و تفکیک گویندگان را هدف قرار می‌دهد. پیش از این نیز شرکت‌هایی مانند میسترال مدل‌های صوتی خود را برای پردازش مکالمات چندنفره و چندزبانه توسعه داده بودند.

از جمله این مدل‌ها، «وُکسترال ترنسکرایب ۲» است که علاوه بر تبدیل گفتار به متن، امکان تفکیک گویندگان و تولید زیرنویس زنده چندزبانه با تأخیر کم را ارائه می‌کند.

مسیر جدید هوش مصنوعی در پردازش مکالمات

توسعه مدل‌هایی مانند میوز ویس ترنسکرایب نشان می‌دهد قابلیت‌های صوتی هوش مصنوعی به سمت پردازش مکالمات واقعی و چندنفره حرکت کرده است. در این مدل‌ها، تنها تبدیل صدا به متن اهمیت ندارد و تشخیص گوینده، زبان و ساختار گفت‌وگو نیز بخشی از فرایند پردازش محسوب می‌شود.

جمع‌بندی

میوز ویس ترنسکرایب جدیدترین مدل صوتی بلادرنگ متا است که برای تبدیل مکالمات چندنفره به متن توسعه یافته و می‌تواند گویندگان و زبان‌های مختلف را در یک جریان صوتی تشخیص دهد. این مدل اکنون در قابلیت دیکته صوتی اپلیکیشن مک متا استفاده شده است.

برچسب ها :

ناموجود
ارسال نظر شما
مجموع نظرات : 0 در انتظار بررسی : 0 انتشار یافته : 0
  • نظرات ارسال شده توسط شما، پس از تایید توسط مدیران سایت منتشر خواهد شد.
  • نظراتی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
  • نظراتی که به غیر از زبان فارسی یا غیر مرتبط با خبر باشد منتشر نخواهد شد.