نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
humain-m3
MiniMax, commissioned by HUMAIN
نموذج عربي متقدم أعلنت عنه HUMAIN في مؤتمر LEAP بالرياض في 3 سبتمبر 2026: نموذج مزيج خبراء بحجم 428 مليار معامل ضمن سلالة MiniMax-M3، خضع لتدريب مسبق إضافي على أكثر من تريليون رمز من المحتوى العربي الأصيل. كُلِّفت به HUMAIN ونفّذته MiniMax. وحتى 10 سبتمبر 2026 لا يزال في مرحلة المعاينة البحثية، ويُتاح عبر منصة HUMAIN Node ونقطة وصول متوافقة مع OpenAI، دون نشر للأوزان. وتفيد HUMAIN بأنها تتوقع إصدار الأوزان بموجب رخصة MiniMax Community License بعد استكمال تدريب السلامة، على أن يكون ذلك مستهدفاً في أكتوبر 2026.
ArabianGPT
Prince Sultan University RIOTU Lab
نماذج GPT صغيرة عربية أصيلة موجهة للبحث ضمن مبادرة ArabianLLM السعودية، نُشرت بأحجام 0.1 و0.3 و0.8 و1.5 مليار معامل مع نسخ مخصصة للإجابة عن الأسئلة والتلخيص وتحليل المشاعر. وهي بحثية الطابع لا إنتاجية؛ إذ لم يتغير المستودع الرئيس منذ فبراير 2024.
AceGPT v2
FreedomIntelligence (KAUST / CUHK-SZ / SRIBD / KAU)
عائلة نماذج لغوية معرَّبة مع مواءمة ثقافية، طُوِّرت بالتعاون بين جامعة الملك عبدالله للعلوم والتقنية وجامعة الملك عبدالعزيز مع الجامعة الصينية بهونغ كونغ في شنجن ومعهد شنجن لأبحاث البيانات الضخمة. وتصدر النسخة الثانية بنماذج أساس ومحادثة بأحجام 8 و32 و70 مليار معامل. ولم تُحدَّث المستودعات منذ نوفمبر 2024، ولا توجد نسخة ثالثة.
Kuwain 1.5B
Misraj AI
نموذج صغير بالعربية والإنجليزية طُوِّر في الخبر عبر حقن اللغة العربية في نموذج إنجليزي قائم بدل التدريب من الصفر، وهو الأساس الذي بُني عليه كل من Mutarjim وLahjawi. تنشر Misraj مجموعات بياناتها وشيفرات التقييم علناً، لكنها لم تُصدر أوزان Kuwain؛ إذ يقتصر حسابها على Hugging Face على مجموعات البيانات، ويُتاح النموذج عبر منصة Kawn التابعة لها.
SILMA Kashif 2B
SILMA AI
نموذج مدمج مُحسَّن للإجابة عن الأسئلة بأسلوب الاسترجاع المعزز (RAG) ولاستخراج الكيانات بالعربية والإنجليزية. وهو مشتق من Gemma ويصدر بموجب شروط استخدام Gemma، وتُنشر إلى جانبه نسخ GGUF ونسخ بدقة 4 بت.
SILMA-9B-Instruct
SILMA AI
نموذج عربي مبني على Gemma تصدّر تصنيفات النماذج العربية المفتوحة متفوقاً على نماذج أكبر منه بكثير. ولأنه مبني على Gemma فإنه يخضع لشروط استخدام Gemma من Google بدلاً من رخصة مفتوحة المصدر معتادة.
ALLaM 34B
SDAIA / NCAI, deployed by HUMAIN
أكبر نماذج عائلة ALLaM. أطلقت سدايا عائلة ALLaM، وتبنّت HUMAIN النموذج بحجم 34 مليار معامل ونشرته ضمن خدمة HUMAIN Chat المغلقة (أغسطس 2025). لم تُنشر الأوزان ولا تقرير تقني ولا واجهة برمجية عامة، ولذلك لا يوجد مستودع يمكن الربط به. وقد قيَّمته دراسة مستقلة على مستوى الواجهة عبر HUMAIN Chat في الفصحى الحديثة وخمس لهجات إقليمية والتناوب اللغوي، دون تسمية تلك اللهجات.
ALLaM-7B-Instruct
SDAIA / NCAI (weights hosted by HUMAIN)
النموذج اللغوي العربي الوطني السعودي من تطوير المركز الوطني للذكاء الاصطناعي التابع لسدايا — أوزان مفتوحة بحجم 7 مليارات معامل، دُرِّب على 4 تريليونات رمز إنجليزي ثم 1.2 تريليون رمز عربي وإنجليزي مختلط. أُعيدت تسمية حساب ALLaM-AI على Hugging Face فصار يحوِّل إلى humain-ai، ومن ثم تُتاح الأوزان ضمن نطاق HUMAIN، بينما ما زالت بطاقة النموذج تنسب التطوير إلى المركز الوطني للذكاء الاصطناعي وسدايا. وتقتصر البطاقة على الفصحى الحديثة والإنجليزية.
سلسلة TII الهجينة التي تجمع بين معمارية Transformer وMamba، وهي نموذجه الرائد الحالي مفتوح الأوزان، وقد صدرت بأحجام تتراوح من 0.5 إلى 34 مليار معامل. وخلافاً لـFalcon 3، تُدرج بطاقة النموذج العربية ضمن 18 لغة مدعومة، ما يجعله أكبر نماذج TII القابلة للتنزيل مع دعم معلن للعربية.
Mistral 7B
Mistral AI
نموذج مفتوح الأوزان عالي الكفاءة وشائع في الحلول الإقليمية؛ والنسخة v0.3 هي إصدار المحادثة الحالي بحجم 7 مليارات معامل وما زالت تحت رخصة Apache 2.0. والعربية ليست لغة معلنة في بطاقة النموذج. ويُلاحظ أن النماذج الأكبر لدى Mistral انتقلت إلى رخصة Mistral البحثية غير المفتوحة، ومن ثم فإن الشروط المتساهلة تخص هذا الحجم لا العائلة كلها.
DeepSeek-R1
DeepSeek
نموذج استدلال مفتوح برخصة MIT الصريحة، يسمح بالاستخدام التجاري وبالاشتقاق منه بما في ذلك التقطير. والعربية ليست لغة مستهدفة معلنة، إذ لا تدرج البطاقة أي لغات، ومن ثم يظل الأداء بالعربية عرضياً. وقد تجاوزه ضمن سلسلة DeepSeek تحديث R1-0528 ثم إصدارات V3.x اللاحقة.
Qwen3
Alibaba
عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.
Llama 4
Meta
عائلة Meta مفتوحة الأوزان في الصف الأول، وتُستخدم على نطاق واسع أساساً للنماذج العربية المخصصة إقليمياً. والعربية إحدى اثنتي عشرة لغة تدرجها Meta لنموذج Llama 4. والرخصة رخصة مجتمع مخصصة تتضمن شروط استخدام مقبول وشرطاً يخص من يتجاوز 700 مليون مستخدم شهرياً، وليست رخصة معتمدة من مبادرة المصدر المفتوح.
AraGPT2
AUB MIND Lab
نموذج GPT-2 عربي دُرِّب على المدونة نفسها المستخدمة في AraBERTv2، وما زال مرجعاً شائعاً لتوليد النص العربي، وقد نُشر بأحجام base وmedium وlarge وmega. ولا تذكر بطاقة النموذج الأساسي أي رخصة.
Aya Expanse 32B
Cohere Labs
نموذج متعدد اللغات مفتوح الأوزان يغطي 23 لغة من بينها العربية. ورخصته غير تجارية (CC-BY-NC-4.0) إضافة إلى ملحق الاستخدام المقبول من Cohere، ولذلك لا يصلح للاستخدام في منتجات عربية تجارية.
Fanar-2-27B
QCRI / HBKU
النموذج الرائد عربي المحور في إصدار Fanar 2.0 (مارس 2026)، واصل التدريب المسبق انطلاقاً من google/gemma-3-27b-pt على نحو 166 مليار رمز عربي وإنجليزي وبرمجي، بنافذة سياق 32 ألف رمز. ويضيف مسارات استدلال عربية أصيلة، ووضع تفكير انتقائي، واستدعاء الأدوات. وهذا المستودع نصي المدخلات والمخرجات، أما توليد الصور وفهمها ونظم الشعر فلها نماذج Fanar-2 منفصلة.
Fanar-1-9B
QCRI / HBKU
النموذج اللغوي العربي السيادي لقطر. هذا النموذج التعليماتي بحجم 8.7 مليار معامل، وهو فرع Prime، يواصل التدريب المسبق لنموذج google/gemma-2-9b على تريليون رمز عربي وإنجليزي، في حين دُرِّب نموذج Star المنفصل بحجم 7 مليارات معامل من الصفر. وتذكر البطاقة دعم الفصحى الحديثة إضافة إلى اللهجات الخليجية والشامية والمصرية، ومواءمة النموذج مع القيم الإسلامية والثقافة العربية.
أول نموذج عربي ضمن سلسلة Falcon (مايو 2025)، بُني على Falcon3-7B بتوسيع المُرمِّز بـ32 ألف رمز عربي والتدريب على بيانات عربية غير مترجمة. أبقاه معهد TII مغلقاً: فلا أوزان منشورة تحت حساب tiiuae، وإنما مجموعات بيانات التقييم فقط، ويُستخدم النموذج عبر chat.falconllm.tii.ae. ويذكر الإعلان دعم الفصحى الحديثة إضافة إلى «لهجات رئيسة» غير مسمّاة.
Falcon 3
TII
سلسلة نماذج لغوية مفتوحة وعالية الكفاءة من معهد TII في أبوظبي. تقتصر بطاقة النموذج على الإنجليزية والفرنسية والإسبانية والبرتغالية، فالعربية ليست لغة مدعومة هنا، ولهذا بنى المعهد نموذج Falcon-Arabic بإضافة 32 ألف رمز عربي إلى هذا المُرمِّز. وللعربية من TII يُستخدم Falcon-H1 أو Falcon-Arabic.
Jais 2
Inception / Cerebras / MBZUAI
خليفة عائلة Jais، صدر بأوزان مفتوحة في أغسطس 2026 بحجمَي 8 و70 مليار معامل للمحادثة، إضافة إلى نسخ GGUF. تذكر بطاقة النموذج أنه يغطي الفصحى الحديثة واللهجات الإقليمية والتناوب اللغوي بين العربية والإنجليزية دون تسمية تلك اللهجات. والمستودعات مقيَّدة بموافقة على مشاركة بيانات التواصل.
Jais 30B
Inception (Core42) / MBZUAI / Cerebras
عائلة نماذج لغوية عربية مفتوحة بارزة تتراوح من 590 مليون إلى 70 مليار معامل، دُرِّبت على منظومة Condor Galaxy من Cerebras. أُعيدت تسمية حساب inceptionai إلى inception42، ولذلك لا يصل الرابط القديم إلا عبر إعادة توجيه؛ والمستودع مقيَّد بموافقة على مشاركة بيانات التواصل ولم يُحدَّث منذ سبتمبر 2024. وقد حلّ Jais 2 محله عملياً.