نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
Arabic Triplet Matryoshka V2
Omer Nacar, RIOTU Lab, Prince Sultan University
نموذج لتمثيل الجمل العربية متجهياً، مبني على AraBERT v0.2 بأسلوب تعلّم تمثيلات Matryoshka، ودُرِّب على ثلاثيات الاستدلال اللغوي الطبيعي بالعربية بحيث يخدم النموذج الواحد عدة أبعاد تمثيل. ويُستخدم على نطاق واسع في البحث الدلالي العربي والاسترجاع لأنظمة RAG، وهو من قلائل نماذج التمثيل العربية الأصيلة ذات الانتساب البحثي السعودي.
GATE-AraBert-v1
Omartificial-Intelligence-Space
نموذج تمثيل متجهي للجمل العربية ينتج متجهات بـ768 بُعداً، ودُرِّب على بيانات الاستدلال اللغوي والتشابه الدلالي بالعربية فوق AraBERTv02. طُوِّر بدعم من جامعة الأمير سلطان في الرياض، وهو الأكثر استخداماً بين نماذج التمثيل العربية ذات المنشأ السعودي. برخصة Apache-2.0.
ArabianGPT
Prince Sultan University RIOTU Lab
نماذج GPT صغيرة عربية أصيلة موجهة للبحث ضمن مبادرة ArabianLLM السعودية، نُشرت بأحجام 0.1 و0.3 و0.8 و1.5 مليار معامل مع نسخ مخصصة للإجابة عن الأسئلة والتلخيص وتحليل المشاعر. وهي بحثية الطابع لا إنتاجية؛ إذ لم يتغير المستودع الرئيس منذ فبراير 2024.
AceGPT v2
FreedomIntelligence (KAUST / CUHK-SZ / SRIBD / KAU)
عائلة نماذج لغوية معرَّبة مع مواءمة ثقافية، طُوِّرت بالتعاون بين جامعة الملك عبدالله للعلوم والتقنية وجامعة الملك عبدالعزيز مع الجامعة الصينية بهونغ كونغ في شنجن ومعهد شنجن لأبحاث البيانات الضخمة. وتصدر النسخة الثانية بنماذج أساس ومحادثة بأحجام 8 و32 و70 مليار معامل. ولم تُحدَّث المستودعات منذ نوفمبر 2024، ولا توجد نسخة ثالثة.
ALLaM-7B-Instruct
SDAIA / NCAI (weights hosted by HUMAIN)
النموذج اللغوي العربي الوطني السعودي من تطوير المركز الوطني للذكاء الاصطناعي التابع لسدايا — أوزان مفتوحة بحجم 7 مليارات معامل، دُرِّب على 4 تريليونات رمز إنجليزي ثم 1.2 تريليون رمز عربي وإنجليزي مختلط. أُعيدت تسمية حساب ALLaM-AI على Hugging Face فصار يحوِّل إلى humain-ai، ومن ثم تُتاح الأوزان ضمن نطاق HUMAIN، بينما ما زالت بطاقة النموذج تنسب التطوير إلى المركز الوطني للذكاء الاصطناعي وسدايا. وتقتصر البطاقة على الفصحى الحديثة والإنجليزية.
Tarteel Whisper Quran ASR
Tarteel AI
نسخة من Whisper-base مُحسَّنة لتلاوة القرآن الكريم بالعربية، وتسجل معدل خطأ في الكلمات قدره 5.75% على مجموعة التقييم الخاصة بها. وهو محدود النطاق بحكم تصميمه إذ يستهدف التلاوة لا العربية المحكية، لكنه أكثر نماذج الكلام العربية المفتوحة اعتماداً خارج نقاط تحقّق Whisper العامة، ويقوم عليه تطبيق Tarteel للحفظ. وتُنشر أيضاً نسخة tiny منه.
Qwen3
Alibaba
عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.
CAMeLBERT
CAMeL Lab, NYU Abu Dhabi
نماذج BERT مُدرَّبة مسبقاً لكل نوع من أنواع العربية (الفصحى الحديثة والعامية والتراثية) لاستخراج الكيانات وتصنيف أقسام الكلام وتحليل المشاعر وتمييز اللهجات. وتبقى نسخة mix المدخل الأكثر استخداماً رغم أنها تعود إلى عام 2021.
Fanar-2-27B
QCRI / HBKU
النموذج الرائد عربي المحور في إصدار Fanar 2.0 (مارس 2026)، واصل التدريب المسبق انطلاقاً من google/gemma-3-27b-pt على نحو 166 مليار رمز عربي وإنجليزي وبرمجي، بنافذة سياق 32 ألف رمز. ويضيف مسارات استدلال عربية أصيلة، ووضع تفكير انتقائي، واستدعاء الأدوات. وهذا المستودع نصي المدخلات والمخرجات، أما توليد الصور وفهمها ونظم الشعر فلها نماذج Fanar-2 منفصلة.
Fanar-1-9B
QCRI / HBKU
النموذج اللغوي العربي السيادي لقطر. هذا النموذج التعليماتي بحجم 8.7 مليار معامل، وهو فرع Prime، يواصل التدريب المسبق لنموذج google/gemma-2-9b على تريليون رمز عربي وإنجليزي، في حين دُرِّب نموذج Star المنفصل بحجم 7 مليارات معامل من الصفر. وتذكر البطاقة دعم الفصحى الحديثة إضافة إلى اللهجات الخليجية والشامية والمصرية، ومواءمة النموذج مع القيم الإسلامية والثقافة العربية.
Jais 2
Inception / Cerebras / MBZUAI
خليفة عائلة Jais، صدر بأوزان مفتوحة في أغسطس 2026 بحجمَي 8 و70 مليار معامل للمحادثة، إضافة إلى نسخ GGUF. تذكر بطاقة النموذج أنه يغطي الفصحى الحديثة واللهجات الإقليمية والتناوب اللغوي بين العربية والإنجليزية دون تسمية تلك اللهجات. والمستودعات مقيَّدة بموافقة على مشاركة بيانات التواصل.
Jais 30B
Inception (Core42) / MBZUAI / Cerebras
عائلة نماذج لغوية عربية مفتوحة بارزة تتراوح من 590 مليون إلى 70 مليار معامل، دُرِّبت على منظومة Condor Galaxy من Cerebras. أُعيدت تسمية حساب inceptionai إلى inception42، ولذلك لا يصل الرابط القديم إلا عبر إعادة توجيه؛ والمستودع مقيَّد بموافقة على مشاركة بيانات التواصل ولم يُحدَّث منذ سبتمبر 2024. وقد حلّ Jais 2 محله عملياً.