نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
Qwen3
Alibaba
عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.
CAMeLBERT
CAMeL Lab, NYU Abu Dhabi
نماذج BERT مُدرَّبة مسبقاً لكل نوع من أنواع العربية (الفصحى الحديثة والعامية والتراثية) لاستخراج الكيانات وتصنيف أقسام الكلام وتحليل المشاعر وتمييز اللهجات. وتبقى نسخة mix المدخل الأكثر استخداماً رغم أنها تعود إلى عام 2021.
Fanar-2-27B
QCRI / HBKU
النموذج الرائد عربي المحور في إصدار Fanar 2.0 (مارس 2026)، واصل التدريب المسبق انطلاقاً من google/gemma-3-27b-pt على نحو 166 مليار رمز عربي وإنجليزي وبرمجي، بنافذة سياق 32 ألف رمز. ويضيف مسارات استدلال عربية أصيلة، ووضع تفكير انتقائي، واستدعاء الأدوات. وهذا المستودع نصي المدخلات والمخرجات، أما توليد الصور وفهمها ونظم الشعر فلها نماذج Fanar-2 منفصلة.
Fanar-1-9B
QCRI / HBKU
النموذج اللغوي العربي السيادي لقطر. هذا النموذج التعليماتي بحجم 8.7 مليار معامل، وهو فرع Prime، يواصل التدريب المسبق لنموذج google/gemma-2-9b على تريليون رمز عربي وإنجليزي، في حين دُرِّب نموذج Star المنفصل بحجم 7 مليارات معامل من الصفر. وتذكر البطاقة دعم الفصحى الحديثة إضافة إلى اللهجات الخليجية والشامية والمصرية، ومواءمة النموذج مع القيم الإسلامية والثقافة العربية.