نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
Tarteel Whisper Quran ASR
Tarteel AI
نسخة من Whisper-base مُحسَّنة لتلاوة القرآن الكريم بالعربية، وتسجل معدل خطأ في الكلمات قدره 5.75% على مجموعة التقييم الخاصة بها. وهو محدود النطاق بحكم تصميمه إذ يستهدف التلاوة لا العربية المحكية، لكنه أكثر نماذج الكلام العربية المفتوحة اعتماداً خارج نقاط تحقّق Whisper العامة، ويقوم عليه تطبيق Tarteel للحفظ. وتُنشر أيضاً نسخة tiny منه.
Audar ASR V1 Turbo
Audar AI Labs
نموذج تعرّف على الكلام يضع العربية أولاً بحجم 2.35 مليار معامل، دُرِّب على أكثر من 300 ألف ساعة، ويذكر تغطيته للهجات الخليجية والمصرية والشامية والمغاربية إضافة إلى التناوب اللغوي مع الإنجليزية. وتدّعي بطاقته صدارة لوحة Open Universal Arabic ASR التي تديرها شركة علم السعودية. برخصة AudarAI المجتمعية الخاصة، وليست مفتوحة المصدر.
Cohere Transcribe Arabic
Cohere Labs
نموذج متخصص لتحويل الكلام العربي إلى نص (يوليو 2026) مبني على نقطة تحقّق Cohere العامة للنسخ الصوتي. وهو من أكثر مستودعات التعرف على الكلام العربي تنزيلاً على Hugging Face، ويحمل ترخيصاً متساهلاً على غير المعتاد في هذا المجال. والمستودع مقيَّد بموافقة على مشاركة بيانات التواصل.
Munsit
CNTXT AI
نموذج للتعرف على الكلام العربي دُرِّب بإشراف ضعيف على أكثر من 30 ألف ساعة، وتزعم الورقة البحثية أنه الأدق في فئته عبر 18 لهجة. ولم تُنشر أي أوزان، إذ لا وجود لحساب CNTXT ولا لمستودع Munsit على Hugging Face، والنموذج متاح تجارياً عبر واجهة برمجية فقط، ولذلك يتعذر التحقق المستقل من ادعاءات اللهجات.
Whisper large-v3
OpenAI
نموذج مفتوح رائد للتعرف على الكلام يغطي أكثر من 99 لغة، وهو الخيار المفتوح الافتراضي للتعرف على الكلام العربي في المنتجات، غير أن العربية فيه لغة من بين لغات كثيرة لا محوراً للتدريب، وتبقى العامية نقطة ضعفه. ويُلاحظ تضارب في الرخصة: فبطاقة هذا النموذج تذكر Apache 2.0، بينما يذكر مستودع openai/whisper على GitHub وبطاقة large-v3-turbo رخصة MIT.