ميتا تطلق Muse Voice Transcribe لتفريغ الصوت الفوري
تكشف مختبرات ميتا للذكاء الفائق عن Muse Voice Transcribe، نموذج واحد يفرّغ الكلام ويميّز حتى 20 متحدثًا ويكتشف التوقفات في الوقت الفعلي، متاح الآن عبر واجهة برمجة التطبيقات وفي تطبيق Meta AI لأجهزة Mac.

كشفت مختبرات ميتا للذكاء الفائق (Meta Superintelligence Labs) في 1 سبتمبر 2026 عن Muse Voice Transcribe، أول نموذج لديها لإدراك الصوت في الوقت الفعلي. يقوم النظام بتفريغ الكلام إلى نص، والتمييز بين أكثر من 20 متحدثًا مختلفًا داخل التسجيل نفسه، واكتشاف اللحظة الدقيقة التي يتوقف فيها شخص عن الحديث؛ وهي ثلاث مهام كانت تتطلب حتى الآن ثلاثة أنظمة منفصلة: واحد للتفريغ، وآخر لفصل المتحدثين (diarization)، وثالث لرصد نهاية الدور، مع ما يضيفه كل ربط بينها من زمن انتقال وأعطال جديدة. النموذج متاح بالفعل عبر واجهة برمجة تطبيقات ميتا تحت اسم muse-voice-transcribe-1.0، ويشغّل الآن خاصية الإملاء الصوتي في تطبيق Meta AI لأجهزة Mac وفي Muse Code، أداة البرمجة المساعِدة التابعة للشركة. لم تنشر ميتا أوزان النموذج، لذا لا يمكن استخدامه إلا كخدمة مستضافة، دون إمكانية تشغيله على خوادم خاصة.
كيف يعمل: الاستماع والكتابة في الحلقة نفسها
ينتمي Muse Voice Transcribe إلى عائلة Muse Spark، ويعالج الصوت في مقاطع مدة كل منها 80 ميلي ثانية، أي 12.5 مقطعًا في الثانية. يتحول كل مقطع إلى رمز (token) يحلله النموذج بطريقة ذاتية الانحدار داخل نفس فك التشفير (decoder) الذي يولّد النص أيضًا، دون وجود مرحلة منفصلة لمطابقة ما يُسمع بما يُكتب، وهي بالضبط النقطة التي كثيرًا ما تفقد فيها الأنظمة التقليدية تزامنها. بعد كل مقطع، يتخذ النموذج قرارًا ثنائيًا: إما أن يتنبأ برمز يطلب منه مواصلة الاستماع، أو أن يُصدر كلمة مباشرة. وعند توقف تدفق الصوت، يخبره رمز خاص بأنه لن تصل معلومات إضافية، فيُصدر فورًا أي نص متبقٍ لم يُخرجه بعد، وهو سلوك تسميه ميتا «الاستماع المرن»، وتستخدمه أيضًا لتحديد من يتحدث في كل لحظة.
تأخير يُدرَّب، لا يُحدَّد مسبقًا
كمية الصوت التي ينتظرها النموذج قبل كتابة كلمة ما، وهو ما تسميه ميتا «التأخير»، ليست قيمة ثابتة: فكلما تراكم سياق أكبر، ازدادت دقة التفريغ، لكن زمن الانتظار يزداد أيضًا. وبدلًا من تحديد هذه الموازنة يدويًا، دربها مهندسو ميتا عبر التعلم المعزز، بالجمع بطريقة ضربية بين مكافأة على الدقة (معدل خطأ الكلمات) ومكافأة على السرعة، بحيث يتعلم النموذج نفسه تغيير مدة التأخير كلمةً بكلمة حسب صعوبتها. ولتحديد هوية المتحدثين، لا يعتمد النظام على نموذج منفصل، بل على رموز خاصة داخل التدفق نفسه: رمز يشير إلى احتمال تبدّل المتحدث فور حدوثه، وآخر، متأخر قليلًا، يُسند وسمًا للمتحدث من A إلى Z؛ وقد يتوزع صوت الشخص نفسه على عدة مقاطع تُحلَّل جميعها إلى الوسم نفسه. ويضاف رمزان آخران لتحديد بداية التدخل الصوتي ونهايته لصالح كاشف نهاية الدور، وتُدرَّب المهام الثلاث معًا فوق نفس مكافأة التفريغ الأساسية.
نتائج تتفوق على Cartesia وElevenLabs وGemini
- معدل خطأ كلمات بنسبة 3.1% في التفريغ النهائي، بعد 0.16 ثانية من نهاية الكلام، في اختبار Artificial Analysis AA-WER Streaming، متفوقًا على Cartesia Ink-2 (3.4% خلال 0.43 ثانية) وElevenLabs Scribe v2 Realtime (3.6% خلال 0.14 ثانية).
- نسبة خطأ 3.6% في أول تفريغ جزئي، خلال 0.13 ثانية فقط؛ نسخة Cartesia Ink-2 التي تعتمد نقاط نهاية خارجية أسرع (0.07 ثانية) لكنها أقل دقة (4.0%).
- معدل خطأ فصل متحدثين بنسبة 17.5% في المتوسط عبر اختبارات AMI-IHM وAMI-SDM وVoxConverse، مقابل نطاق يتراوح بين 21.1% و28.6% في الأنظمة الخمسة الأخرى المُختبرة.
- يدعم تسجيلات تتجاوز الساعة وأكثر من 20 متحدثًا في الوقت نفسه دون أي معالجة إضافية لاحقة؛ ويمكن رفع الدقة أكثر عبر ضبط اللغة والكلمات المفتاحية والسياق.
- السعر 3 دولارات لكل 1000 دقيقة صوت معالَجة (0.18 دولار للساعة)، أقل من 4 دولارات Cartesia Ink-2، وأقل من نصف سعر ElevenLabs Scribe v2 Realtime وDeepgram Flux البالغ 6.50 دولارات.
دُرِّب النموذج على أكثر من 70 لغة، خضعت 25 منها لتحقق شامل قبل الإطلاق، وهو يتعامل بشكل طبيعي مع تبديل اللغة في منتصف الجملة الواحدة دون فقدان الدقة، وهو أمر شائع بين المتحدثين ثنائيي اللغة. أعلنت ميتا عن هذا الإطلاق في 1 سبتمبر 2026 عبر حسابها @AIatMeta على منصة X، ووصفته بأنه أول نموذج إدراكي فوري لديها، في خطوة تسبق أي نظام مماثل للتفريغ الفوري من OpenAI أو Google. ويمكن لمن ثبّت تطبيق Meta AI على جهاز Mac تجربته الآن: يكفي الضغط باستمرار على مفتاح Fn والتحدث داخل أي تطبيق ليتم تفريغ الإملاء الصوتي بواسطة النموذج الجديد.
بالنسبة للشركات والمهنيين في المنطقة العربية الذين يسجّلون اجتماعات أو مؤتمرات صحفية أو مقابلات يتحدث فيها عدة أشخاص في آن واحد -الصحفيون، مكاتب المحاماة، فرق خدمة العملاء، خدمات إتاحة المحتوى للصم وضعاف السمع- فإن نموذجًا يفرّغ الكلام ويفصل الأصوات ويكتشف التوقفات في خطوة واحدة يقلّص تكلفة البنية التحتية وهامش الخطأ الناتج عن ربط عدة أدوات ببعضها. في المقابل، يجب تقبّل أن استخدامه لا يتم إلا عبر واجهة برمجة تطبيقات ميتا، دون خيار استضافته على خوادم خاصة أو تدقيق أوزانه. وقبل استبدال مسار تفريغ صوتي يعمل بالفعل في الإنتاج، يُستحسن مقارنة معدل الخطأ الفعلي بلغة ولهجة كل فريق، إذ لم يخضع للتحقق الشامل سوى 25 لغة من أصل أكثر من 70 لغة مدعومة.
المصادر
- Meta Superintelligence Labs Releases Muse Voice Transcribe: One Real-Time Model for Streaming ASR, Diarization, and EndpointingMarkTechPost · ١ سبتمبر ٢٠٢٦
- Meta lanza Muse Voice Transcribe, su IA de transcripción en vivoHipertextual · ١ سبتمبر ٢٠٢٦


