نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
سلسلة TII الهجينة التي تجمع بين معمارية Transformer وMamba، وهي نموذجه الرائد الحالي مفتوح الأوزان، وقد صدرت بأحجام تتراوح من 0.5 إلى 34 مليار معامل. وخلافاً لـFalcon 3، تُدرج بطاقة النموذج العربية ضمن 18 لغة مدعومة، ما يجعله أكبر نماذج TII القابلة للتنزيل مع دعم معلن للعربية.
Audar ASR V1 Turbo
Audar AI Labs
نموذج تعرّف على الكلام يضع العربية أولاً بحجم 2.35 مليار معامل، دُرِّب على أكثر من 300 ألف ساعة، ويذكر تغطيته للهجات الخليجية والمصرية والشامية والمغاربية إضافة إلى التناوب اللغوي مع الإنجليزية. وتدّعي بطاقته صدارة لوحة Open Universal Arabic ASR التي تديرها شركة علم السعودية. برخصة AudarAI المجتمعية الخاصة، وليست مفتوحة المصدر.
Qwen3
Alibaba
عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.
Whisper large-v3
OpenAI
نموذج مفتوح رائد للتعرف على الكلام يغطي أكثر من 99 لغة، وهو الخيار المفتوح الافتراضي للتعرف على الكلام العربي في المنتجات، غير أن العربية فيه لغة من بين لغات كثيرة لا محوراً للتدريب، وتبقى العامية نقطة ضعفه. ويُلاحظ تضارب في الرخصة: فبطاقة هذا النموذج تذكر Apache 2.0، بينما يذكر مستودع openai/whisper على GitHub وبطاقة large-v3-turbo رخصة MIT.