میوز ویس ترنسکرایب متا چگونه کار میکند؟

به گزارش تجارگستران ؛ متا از مدل هوش مصنوعی جدیدی با نام «میوز ویس ترنسکرایب» رونمایی کرده است که میتواند گفتوگوهای چندنفره را بهصورت بلادرنگ به متن تبدیل کند. این مدل علاوه بر تشخیص بیش از ۲۰ گوینده، توانایی شناسایی زبانهای مختلف در یک جریان صوتی را نیز دارد.
هوش مصنوعی متا مکالمات چندنفره را زنده به متن تبدیل میکند
«میوز ویس ترنسکرایب» نخستین مدل صوتی بلادرنگ آزمایشگاه ابرهوش متا محسوب میشود و قادر است در جریان یک مکالمه، صحبت افراد مختلف را از یکدیگر تفکیک کند.
یکی از قابلیتهای اصلی این مدل، تشخیص گوینده است. متا اعلام کرده که مدل جدید میتواند بیش از ۲۰ نفر را در یک مکالمه مدیریت کند و مشخص کند هر بخش از متن به کدام گوینده مربوط است.
پشتیبانی همزمان از چند زبان
میوز ویس ترنسکرایب تنها به شناسایی گویندگان محدود نیست و میتواند تغییر زبان در جریان یک گفتوگو را نیز مدیریت کند.
برای مثال، اگر افراد حاضر در یک جلسه از زبانهای مختلف استفاده کنند، مدل میتواند تغییر زبان را در فرایند رونویسی تشخیص دهد. این ویژگی برای جلسات چندزبانه، مصاحبهها و گفتوگوهای گروهی کاربرد دارد.
| قابلیت | عملکرد میوز ویس ترنسکرایب |
|---|
| تبدیل گفتار به متن | بهصورت بلادرنگ |
| تشخیص گوینده | تفکیک بیش از ۲۰ گوینده |
| تشخیص زبان | پشتیبانی از زبانهای مختلف در یک جریان صوتی |
| تشخیص پایان گفتار | بهصورت بومی در مدل |
| پردازش صوت | در قالب یک مدل واحد |
| کاربرد فعلی | دیکته صوتی در اپلیکیشن مک متا |
چند قابلیت صوتی در یک مدل واحد
متا اعلام کرده است که تشخیص گوینده، تشخیص پایان بخشهای گفتار و تبدیل صوت به متن در این مدل بهصورت بومی انجام میشود.
ترکیب این قابلیتها در یک مدل واحد میتواند نیاز به استفاده همزمان از چند سامانه جداگانه برای پردازش یک مکالمه را کاهش دهد. در نتیجه، فرایند تبدیل گفتوگوی صوتی به متن با ساختار یکپارچهتری انجام میشود.
استفاده از مدل در اپلیکیشن مک متا
این فناوری همزمان با معرفی، در قابلیت دیکته صوتی اپلیکیشن مک متا نیز مورد استفاده قرار گرفته است. کاربران در این بخش میتوانند صحبت کنند و محتوای صوتی آنها به متن تبدیل شود.
با وجود آغاز استفاده از مدل در این قابلیت، متا هنوز درباره ادغام گستردهتر میوز ویس ترنسکرایب در سایر محصولات و سرویسهای خود جزئیات بیشتری اعلام نکرده است.
رقابت متا و گوگل در مدلهای صوتی
معرفی مدل جدید متا در شرایطی انجام شده که شرکتهای فناوری روی توسعه مدلهایی برای درک سریعتر و دقیقتر گفتوگوهای صوتی تمرکز کردهاند.
گوگل نیز چند روز پیش از یک مدل صوتی جدید رونمایی کرده بود که قابلیتهایی از جمله پردازش صوت و تفکیک گویندگان را هدف قرار میدهد. پیش از این نیز شرکتهایی مانند میسترال مدلهای صوتی خود را برای پردازش مکالمات چندنفره و چندزبانه توسعه داده بودند.
از جمله این مدلها، «وُکسترال ترنسکرایب ۲» است که علاوه بر تبدیل گفتار به متن، امکان تفکیک گویندگان و تولید زیرنویس زنده چندزبانه با تأخیر کم را ارائه میکند.
مسیر جدید هوش مصنوعی در پردازش مکالمات
توسعه مدلهایی مانند میوز ویس ترنسکرایب نشان میدهد قابلیتهای صوتی هوش مصنوعی به سمت پردازش مکالمات واقعی و چندنفره حرکت کرده است. در این مدلها، تنها تبدیل صدا به متن اهمیت ندارد و تشخیص گوینده، زبان و ساختار گفتوگو نیز بخشی از فرایند پردازش محسوب میشود.
جمعبندی
میوز ویس ترنسکرایب جدیدترین مدل صوتی بلادرنگ متا است که برای تبدیل مکالمات چندنفره به متن توسعه یافته و میتواند گویندگان و زبانهای مختلف را در یک جریان صوتی تشخیص دهد. این مدل اکنون در قابلیت دیکته صوتی اپلیکیشن مک متا استفاده شده است.
برچسب ها :
ناموجود- نظرات ارسال شده توسط شما، پس از تایید توسط مدیران سایت منتشر خواهد شد.
- نظراتی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
- نظراتی که به غیر از زبان فارسی یا غیر مرتبط با خبر باشد منتشر نخواهد شد.


ارسال نظر شما
مجموع نظرات : 0 در انتظار بررسی : 0 انتشار یافته : 0