نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
سلسلة TII الهجينة التي تجمع بين معمارية Transformer وMamba، وهي نموذجه الرائد الحالي مفتوح الأوزان، وقد صدرت بأحجام تتراوح من 0.5 إلى 34 مليار معامل. وخلافاً لـFalcon 3، تُدرج بطاقة النموذج العربية ضمن 18 لغة مدعومة، ما يجعله أكبر نماذج TII القابلة للتنزيل مع دعم معلن للعربية.
Mistral 7B
Mistral AI
نموذج مفتوح الأوزان عالي الكفاءة وشائع في الحلول الإقليمية؛ والنسخة v0.3 هي إصدار المحادثة الحالي بحجم 7 مليارات معامل وما زالت تحت رخصة Apache 2.0. والعربية ليست لغة معلنة في بطاقة النموذج. ويُلاحظ أن النماذج الأكبر لدى Mistral انتقلت إلى رخصة Mistral البحثية غير المفتوحة، ومن ثم فإن الشروط المتساهلة تخص هذا الحجم لا العائلة كلها.
DeepSeek-R1
DeepSeek
نموذج استدلال مفتوح برخصة MIT الصريحة، يسمح بالاستخدام التجاري وبالاشتقاق منه بما في ذلك التقطير. والعربية ليست لغة مستهدفة معلنة، إذ لا تدرج البطاقة أي لغات، ومن ثم يظل الأداء بالعربية عرضياً. وقد تجاوزه ضمن سلسلة DeepSeek تحديث R1-0528 ثم إصدارات V3.x اللاحقة.
Qwen3
Alibaba
عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.
Llama 4
Meta
عائلة Meta مفتوحة الأوزان في الصف الأول، وتُستخدم على نطاق واسع أساساً للنماذج العربية المخصصة إقليمياً. والعربية إحدى اثنتي عشرة لغة تدرجها Meta لنموذج Llama 4. والرخصة رخصة مجتمع مخصصة تتضمن شروط استخدام مقبول وشرطاً يخص من يتجاوز 700 مليون مستخدم شهرياً، وليست رخصة معتمدة من مبادرة المصدر المفتوح.
Aya Expanse 32B
Cohere Labs
نموذج متعدد اللغات مفتوح الأوزان يغطي 23 لغة من بينها العربية. ورخصته غير تجارية (CC-BY-NC-4.0) إضافة إلى ملحق الاستخدام المقبول من Cohere، ولذلك لا يصلح للاستخدام في منتجات عربية تجارية.