نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
Mistral 7B
Mistral AI
نموذج مفتوح الأوزان عالي الكفاءة وشائع في الحلول الإقليمية؛ والنسخة v0.3 هي إصدار المحادثة الحالي بحجم 7 مليارات معامل وما زالت تحت رخصة Apache 2.0. والعربية ليست لغة معلنة في بطاقة النموذج. ويُلاحظ أن النماذج الأكبر لدى Mistral انتقلت إلى رخصة Mistral البحثية غير المفتوحة، ومن ثم فإن الشروط المتساهلة تخص هذا الحجم لا العائلة كلها.
Qwen3
Alibaba
عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.
Whisper large-v3
OpenAI
نموذج مفتوح رائد للتعرف على الكلام يغطي أكثر من 99 لغة، وهو الخيار المفتوح الافتراضي للتعرف على الكلام العربي في المنتجات، غير أن العربية فيه لغة من بين لغات كثيرة لا محوراً للتدريب، وتبقى العامية نقطة ضعفه. ويُلاحظ تضارب في الرخصة: فبطاقة هذا النموذج تذكر Apache 2.0، بينما يذكر مستودع openai/whisper على GitHub وبطاقة large-v3-turbo رخصة MIT.