Skip to main content

ثروت فردا

سرخط خبرها:

فناوری که صدا را به متن تبدیل می‌کند

فناوری که صدا را به متن تبدیل می‌کند

Muse Voice Transcribe جدیدترین مدل متا برای پردازش و رونویسی بلادرنگ صداست که با تمرکز بر تشخیص هم‌زمان چند گوینده و پشتیبانی از زبان‌های متعدد معرفی شده است. به گزارش ثروت فردا، متا اعلام کرده این مدل علاوه بر تبدیل گفتار به متن، می‌تواند گویندگان مختلف را از یکدیگر تفکیک…

- اندازه متن +

Muse Voice Transcribe جدیدترین مدل متا برای پردازش و رونویسی بلادرنگ صداست که با تمرکز بر تشخیص هم‌زمان چند گوینده و پشتیبانی از زبان‌های متعدد معرفی شده است. به گزارش ثروت فردا، متا اعلام کرده این مدل علاوه بر تبدیل گفتار به متن، می‌تواند گویندگان مختلف را از یکدیگر تفکیک کند و در مکالمات چندزبانه نیز تغییر زبان را تشخیص دهد.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

Muse Voice Transcribe

آزاد کبیری: مدل جدید Muse Voice Transcribe می‌تواند گفتار بیش از ۲۰ نفر و بیش از ۲۰ زبان را به‌صورت هم‌زمان رونویسی کند.

متا مدل جدیدی برای رونویسی لحظه‌ای صدا با نام Muse Voice Transcribe معرفی کرد که به گفته این شرکت می‌تواند گفتار بیش از ۲۰ گوینده را تشخیص دهد و هم‌زمان با چند زبان کار کند. این مدل همچنین می‌تواند هنگام تغییر زبان در میانه جمله، زبان‌های مختلف را تشخیص دهد و متن را بر همان اساس رونویسی کند.

Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ متا است و برای تبدیل گفتار به متن در حالت استریم طراحی شده است. این مدل قابلیت‌هایی مانند تفکیک گویندگان و تشخیص زمان پایان گفتار را در یک مدل واحد ارائه می‌کند.

مدل تبدیل گفتار به متن متا: Muse Voice Transcribe

«مارک زاکربرگ»، مدیرعامل متا، نمونه‌ای از عملکرد این مدل را در شبکه اجتماعی ایکس منتشر کرده است. در این ویدیو، سیستم می‌تواند چند گوینده را از یکدیگر تشخیص دهد و هنگام صحبت‌کردن افراد به زبان‌های مختلف، زبان گفتار را به‌صورت خودکار تغییر دهد.

این مدل همچنین از قابلیتی موسوم به تغییر زبانی پشتیبانی می‌کند؛ به این معنا که اگر فردی در یک جمله از واژه‌های چند زبان استفاده کند، سیستم می‌تواند این تغییر را تشخیص دهد و جمله را رونویسی کند.

زاکربرگ درباره نحوه عملکرد مدل توضیح داده است: «مدل تصمیم می‌گیرد چه زمانی گوش بدهد. برای واژه‌های دشوار کمی بیشتر صبر می‌کند و برای واژه‌های ساده سریع‌تر نتیجه را ثبت می‌کند.» به گفته او، این فرایند با استفاده از تأخیر تطبیقی انجام می‌شود تا مدل بتواند توکن بعدی را پیش‌بینی و دقت رونویسی را افزایش دهد.

زاکربرگ همچنین گفته است مدل برای کار با صدای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان آموزش داده شده است. به گفته او، Muse Voice Transcribe می‌تواند جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از معرفی مدل صوتی Gemini ۳.۵ Transcribe گوگل انجام داده است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامه‌ای برای استفاده از Muse Voice Transcribe در سرویس‌های اصلی خود دارد.

درحال‌حاضر، کاربران می‌توانند قابلیت‌های این مدل را در اپلیکیشن دسکتاپ Meta AI برای مک تجربه کنند. این مدل برای توسعه‌دهندگان نیز از طریق Muse Code و Model API متا در دسترس است. هزینه استفاده از API برابر با ۳ دلار به ازای هر هزار دقیقه صوت اعلام شده است.

Muse Voice Transcribe و تحول رونویسی صوتی

Muse Voice Transcribe رویکردی متفاوت نسبت به سامانه‌های سنتی تبدیل گفتار به متن دارد. این مدل برای پردازش صوت به‌صورت استریم طراحی شده و می‌تواند هم‌زمان وظایفی مانند تشخیص گفتار، تفکیک گویندگان و تشخیص پایان صحبت را انجام دهد. متا می‌گوید این مدل نخستین مدل ادراک صوتی بلادرنگ این شرکت در خانواده جدید Muse است.

یکی از ویژگی‌های مهم Muse Voice Transcribe، توانایی پردازش مکالمات واقعی و نامنظم است؛ شرایطی که در آن چند نفر صحبت می‌کنند، افراد حرف یکدیگر را قطع می‌کنند یا زبان مکالمه تغییر می‌کند.

Muse Voice Transcribe و تشخیص چند گوینده

یکی از قابلیت‌های کلیدی Muse Voice Transcribe تفکیک گویندگان است. طبق اطلاعات رسمی متا، این مدل می‌تواند مکالمات طولانی با بیش از ۲۰ گوینده را بدون نیاز به پردازش پس از ضبط مدیریت کند.

این قابلیت می‌تواند برای جلسات کاری، نشست‌های گروهی، مصاحبه‌ها و گفت‌وگوهای چندنفره اهمیت زیادی داشته باشد؛ زیرا خروجی رونویسی فقط متن خام نیست و مدل تلاش می‌کند مشخص کند هر بخش از صحبت مربوط به کدام گوینده است.

Muse Voice Transcribe و پشتیبانی چندزبانه

Muse Voice Transcribe برای کار با زبان‌های متعدد آموزش دیده است. متا اعلام کرده این مدل با بیش از ۷۰ زبان آموزش داده شده و ۲۵ زبان نیز به‌صورت گسترده اعتبارسنجی شده‌اند. قابلیت تشخیص تغییر زبان در میان یک جمله نیز از ویژگی‌های مهم آن محسوب می‌شود.

این ویژگی می‌تواند برای مکالمات بین‌المللی و محیط‌هایی که کاربران به‌صورت طبیعی میان چند زبان جابه‌جا می‌شوند، کاربرد ویژه‌ای داشته باشد.

Muse Voice Transcribe و رونویسی بلادرنگ

تمرکز اصلی Muse Voice Transcribe بر کاهش فاصله میان صحبت‌کردن و نمایش متن است. متا برای این مدل قابلیتی با عنوان «تأخیر تطبیقی» معرفی کرده که میزان انتظار برای پردازش هر واژه را بر اساس دشواری آن تغییر می‌دهد. به این ترتیب، مدل تلاش می‌کند میان سرعت و دقت تعادل برقرار کند.

این فناوری می‌تواند تجربه کاربر در ابزارهای دیکته صوتی، دستیارهای هوشمند و برنامه‌های مبتنی بر صدا را بهبود دهد.

کاربردهای Muse Voice Transcribe

کاربرد Muse Voice Transcribe تنها به تبدیل فایل صوتی به متن محدود نیست. این مدل در حال حاضر برای قابلیت‌های دیکته صوتی در Meta AI و Muse Code نیز مورد استفاده قرار گرفته است.

متا همچنین اعلام کرده این مدل از طریق Meta Model API، Meta AI برای مک و Muse Code در دسترس است.

این موضوع نشان می‌دهد متا قصد دارد فناوری تشخیص گفتار خود را علاوه بر محصولات مصرفی، در اختیار توسعه‌دهندگان نیز قرار دهد.

چشم‌انداز Muse Voice Transcribe

ورود مدل‌هایی مانند Muse Voice Transcribe می‌تواند رقابت در حوزه تبدیل گفتار به متن را افزایش دهد. ترکیب رونویسی بلادرنگ، تشخیص گویندگان، پردازش چندزبانه و پشتیبانی از مکالمات طولانی، مسیر توسعه ابزارهای صوتی مبتنی بر هوش مصنوعی را گسترده‌تر می‌کند.

در آینده، چنین مدل‌هایی می‌توانند در جلسات آنلاین، دستیارهای شخصی، نرم‌افزارهای کاری، تولید محتوا و ابزارهای دسترسی‌پذیری نقش پررنگ‌تری داشته باشند.

لینک پیشنهادی

ارسال دیدگاه
0 دیدگاه

نظر شما در مورد این مطلب چیه؟

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *