نماذج مختبرة من المجتمع

نماذج الذكاء الاصطناعي مختبرة للعربية

هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.

دعم العربية:الكلكاملجزئيبدون

Arabic Triplet Matryoshka V2

Omer Nacar, RIOTU Lab, Prince Sultan University

التضمين
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىar

نموذج لتمثيل الجمل العربية متجهياً، مبني على AraBERT v0.2 بأسلوب تعلّم تمثيلات Matryoshka، ودُرِّب على ثلاثيات الاستدلال اللغوي الطبيعي بالعربية بحيث يخدم النموذج الواحد عدة أبعاد تمثيل. ويُستخدم على نطاق واسع في البحث الدلالي العربي والاسترجاع لأنظمة RAG، وهو من قلائل نماذج التمثيل العربية الأصيلة ذات الانتساب البحثي السعودي.

humain-m3

MiniMax, commissioned by HUMAIN

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

نموذج عربي متقدم أعلنت عنه HUMAIN في مؤتمر LEAP بالرياض في 3 سبتمبر 2026: نموذج مزيج خبراء بحجم 428 مليار معامل ضمن سلالة MiniMax-M3، خضع لتدريب مسبق إضافي على أكثر من تريليون رمز من المحتوى العربي الأصيل. كُلِّفت به HUMAIN ونفّذته MiniMax. وحتى 10 سبتمبر 2026 لا يزال في مرحلة المعاينة البحثية، ويُتاح عبر منصة HUMAIN Node ونقطة وصول متوافقة مع OpenAI، دون نشر للأوزان. وتفيد HUMAIN بأنها تتوقع إصدار الأوزان بموجب رخصة MiniMax Community License بعد استكمال تدريب السلامة، على أن يكون ذلك مستهدفاً في أكتوبر 2026.

GATE-AraBert-v1

Omartificial-Intelligence-Space

التضمين
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىar

نموذج تمثيل متجهي للجمل العربية ينتج متجهات بـ768 بُعداً، ودُرِّب على بيانات الاستدلال اللغوي والتشابه الدلالي بالعربية فوق AraBERTv02. طُوِّر بدعم من جامعة الأمير سلطان في الرياض، وهو الأكثر استخداماً بين نماذج التمثيل العربية ذات المنشأ السعودي. برخصة Apache-2.0.

ArabianGPT

Prince Sultan University RIOTU Lab

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىar

نماذج GPT صغيرة عربية أصيلة موجهة للبحث ضمن مبادرة ArabianLLM السعودية، نُشرت بأحجام 0.1 و0.3 و0.8 و1.5 مليار معامل مع نسخ مخصصة للإجابة عن الأسئلة والتلخيص وتحليل المشاعر. وهي بحثية الطابع لا إنتاجية؛ إذ لم يتغير المستودع الرئيس منذ فبراير 2024.

AceGPT v2

FreedomIntelligence (KAUST / CUHK-SZ / SRIBD / KAU)

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىarenzh

عائلة نماذج لغوية معرَّبة مع مواءمة ثقافية، طُوِّرت بالتعاون بين جامعة الملك عبدالله للعلوم والتقنية وجامعة الملك عبدالعزيز مع الجامعة الصينية بهونغ كونغ في شنجن ومعهد شنجن لأبحاث البيانات الضخمة. وتصدر النسخة الثانية بنماذج أساس ومحادثة بأحجام 8 و32 و70 مليار معامل. ولم تُحدَّث المستودعات منذ نوفمبر 2024، ولا توجد نسخة ثالثة.

Lahjawi

Misraj AI

الترجمة
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىخليجيمصريشاميar

نظام للترجمة بين اللهجات العربية من شركة Misraj في الخبر، مُحسَّن انطلاقاً من Kuwain-1.5B في نسختين: Lahjawi-D2D للترجمة بين 15 لهجة عربية، وLahjawi-D2MSA لتحويل أي لهجة إلى الفصحى الحديثة. وتذكر الورقة البحثية اللهجات المصرية والإماراتية والأردنية والفلسطينية والشامية والمغاربية ضمن ما قُيِّم عليه، دون تعداد اللهجات الخمس عشرة كاملة. ولم تُنشر الأوزان.

Mutarjim

Misraj AI

الترجمة
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

نموذج ترجمة مدمج ثنائي الاتجاه بين العربية والإنجليزية، مُحسَّن انطلاقاً من Kuwain-1.5B، وتفيد التقارير بأنه يحقق أفضل النتائج على معيار Tarjama-25 الذي نشرته Misraj أيضاً. والأوزان غير متاحة على Hugging Face؛ فقد أصدرت Misraj مجموعة بيانات Tarjama-25 وشيفرة التقييم، وأبقت النموذج نفسه ضمن منصة Kawn.

Kuwain 1.5B

Misraj AI

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

نموذج صغير بالعربية والإنجليزية طُوِّر في الخبر عبر حقن اللغة العربية في نموذج إنجليزي قائم بدل التدريب من الصفر، وهو الأساس الذي بُني عليه كل من Mutarjim وLahjawi. تنشر Misraj مجموعات بياناتها وشيفرات التقييم علناً، لكنها لم تُصدر أوزان Kuwain؛ إذ يقتصر حسابها على Hugging Face على مجموعات البيانات، ويُتاح النموذج عبر منصة Kawn التابعة لها.

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

نموذج مدمج مُحسَّن للإجابة عن الأسئلة بأسلوب الاسترجاع المعزز (RAG) ولاستخراج الكيانات بالعربية والإنجليزية. وهو مشتق من Gemma ويصدر بموجب شروط استخدام Gemma، وتُنشر إلى جانبه نسخ GGUF ونسخ بدقة 4 بت.

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

نموذج عربي مبني على Gemma تصدّر تصنيفات النماذج العربية المفتوحة متفوقاً على نماذج أكبر منه بكثير. ولأنه مبني على Gemma فإنه يخضع لشروط استخدام Gemma من Google بدلاً من رخصة مفتوحة المصدر معتادة.

ALLaM 34B

SDAIA / NCAI, deployed by HUMAIN

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

أكبر نماذج عائلة ALLaM. أطلقت سدايا عائلة ALLaM، وتبنّت HUMAIN النموذج بحجم 34 مليار معامل ونشرته ضمن خدمة HUMAIN Chat المغلقة (أغسطس 2025). لم تُنشر الأوزان ولا تقرير تقني ولا واجهة برمجية عامة، ولذلك لا يوجد مستودع يمكن الربط به. وقد قيَّمته دراسة مستقلة على مستوى الواجهة عبر HUMAIN Chat في الفصحى الحديثة وخمس لهجات إقليمية والتناوب اللغوي، دون تسمية تلك اللهجات.

ALLaM-7B-Instruct

SDAIA / NCAI (weights hosted by HUMAIN)

نموذج لغوي
لا توجد تقييمات بعد
🇸🇦 مطوَّر في السعوديةالعربية: دعم كاملالفصحىaren

النموذج اللغوي العربي الوطني السعودي من تطوير المركز الوطني للذكاء الاصطناعي التابع لسدايا — أوزان مفتوحة بحجم 7 مليارات معامل، دُرِّب على 4 تريليونات رمز إنجليزي ثم 1.2 تريليون رمز عربي وإنجليزي مختلط. أُعيدت تسمية حساب ALLaM-AI على Hugging Face فصار يحوِّل إلى humain-ai، ومن ثم تُتاح الأوزان ضمن نطاق HUMAIN، بينما ما زالت بطاقة النموذج تنسب التطوير إلى المركز الوطني للذكاء الاصطناعي وسدايا. وتقتصر البطاقة على الفصحى الحديثة والإنجليزية.

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم جزئيالفصحىarenmulti

سلسلة TII الهجينة التي تجمع بين معمارية Transformer وMamba، وهي نموذجه الرائد الحالي مفتوح الأوزان، وقد صدرت بأحجام تتراوح من 0.5 إلى 34 مليار معامل. وخلافاً لـFalcon 3، تُدرج بطاقة النموذج العربية ضمن 18 لغة مدعومة، ما يجعله أكبر نماذج TII القابلة للتنزيل مع دعم معلن للعربية.

AIN

MBZUAI

الرؤية
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىaren

نموذج متعدد الوسائط ثنائي اللغة بالعربية والإنجليزية مبني على Qwen2-VL ومدرَّب على 3.6 مليون عينة متعددة الوسائط، نحو ثلثها عربي أصيل. يتميز في التعرف الضوئي على الحروف العربية وفهم المستندات، وخضع لتقييم بشري في 17 دولة عربية. برخصة MIT.

التعرف على الكلام
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىar

نسخة من Whisper-base مُحسَّنة لتلاوة القرآن الكريم بالعربية، وتسجل معدل خطأ في الكلمات قدره 5.75% على مجموعة التقييم الخاصة بها. وهو محدود النطاق بحكم تصميمه إذ يستهدف التلاوة لا العربية المحكية، لكنه أكثر نماذج الكلام العربية المفتوحة اعتماداً خارج نقاط تحقّق Whisper العامة، ويقوم عليه تطبيق Tarteel للحفظ. وتُنشر أيضاً نسخة tiny منه.

Audar ASR V1 Turbo

Audar AI Labs

التعرف على الكلام
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىخليجيمصريشاميarenmulti

نموذج تعرّف على الكلام يضع العربية أولاً بحجم 2.35 مليار معامل، دُرِّب على أكثر من 300 ألف ساعة، ويذكر تغطيته للهجات الخليجية والمصرية والشامية والمغاربية إضافة إلى التناوب اللغوي مع الإنجليزية. وتدّعي بطاقته صدارة لوحة Open Universal Arabic ASR التي تديرها شركة علم السعودية. برخصة AudarAI المجتمعية الخاصة، وليست مفتوحة المصدر.

Qwen3

Alibaba

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىنجديشاميمصريarenmulti

عائلة نماذج مفتوحة. وهي النموذج الوحيد في هذا الدليل الذي تذكر جهته المطوّرة لهجة سعودية صراحةً: إذ توثّق Qwen دعم 119 لغة ولهجة، من بينها العربية (الفصحى والنجدية والشامية والمصرية وغيرها). برخصة Apache-2.0.

Munsit

CNTXT AI

التعرف على الكلام
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىخليجيمصريشاميar

نموذج للتعرف على الكلام العربي دُرِّب بإشراف ضعيف على أكثر من 30 ألف ساعة، وتزعم الورقة البحثية أنه الأدق في فئته عبر 18 لهجة. ولم تُنشر أي أوزان، إذ لا وجود لحساب CNTXT ولا لمستودع Munsit على Hugging Face، والنموذج متاح تجارياً عبر واجهة برمجية فقط، ولذلك يتعذر التحقق المستقل من ادعاءات اللهجات.

التعرف على الكلام
لا توجد تقييمات بعد
العربية: دعم جزئيالفصحىarenmulti

نموذج مفتوح رائد للتعرف على الكلام يغطي أكثر من 99 لغة، وهو الخيار المفتوح الافتراضي للتعرف على الكلام العربي في المنتجات، غير أن العربية فيه لغة من بين لغات كثيرة لا محوراً للتدريب، وتبقى العامية نقطة ضعفه. ويُلاحظ تضارب في الرخصة: فبطاقة هذا النموذج تذكر Apache 2.0، بينما يذكر مستودع openai/whisper على GitHub وبطاقة large-v3-turbo رخصة MIT.

CAMeLBERT

CAMeL Lab, NYU Abu Dhabi

أخرى
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىخليجيمصريشاميar

نماذج BERT مُدرَّبة مسبقاً لكل نوع من أنواع العربية (الفصحى الحديثة والعامية والتراثية) لاستخراج الكيانات وتصنيف أقسام الكلام وتحليل المشاعر وتمييز اللهجات. وتبقى نسخة mix المدخل الأكثر استخداماً رغم أنها تعود إلى عام 2021.

AraGPT2

AUB MIND Lab

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىar

نموذج GPT-2 عربي دُرِّب على المدونة نفسها المستخدمة في AraBERTv2، وما زال مرجعاً شائعاً لتوليد النص العربي، وقد نُشر بأحجام base وmedium وlarge وmega. ولا تذكر بطاقة النموذج الأساسي أي رخصة.

AraBERT

AUB MIND Lab

أخرى
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىar

أول مُرمِّز BERT عربي، وما زال المرجع الأساسي في أعمال معالجة اللغة العربية. وقد صارت بطاقة النموذج الأصلي bert-base-arabert تشير إلى أن نسخة أحدث حلّت محلها، ولذلك يشير هذا السجل إلى AraBERT v0.2 base، وهي النسخة الأكثر تنزيلاً والمدرَّبة على 77 غيغابايت من النصوص العربية. ولا تذكر بطاقة النموذج ولا مستودع aub-mind/arabert على GitHub أي رخصة.

Fanar-2-27B

QCRI / HBKU

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىخليجيشاميمصريaren

النموذج الرائد عربي المحور في إصدار Fanar 2.0 (مارس 2026)، واصل التدريب المسبق انطلاقاً من google/gemma-3-27b-pt على نحو 166 مليار رمز عربي وإنجليزي وبرمجي، بنافذة سياق 32 ألف رمز. ويضيف مسارات استدلال عربية أصيلة، ووضع تفكير انتقائي، واستدعاء الأدوات. وهذا المستودع نصي المدخلات والمخرجات، أما توليد الصور وفهمها ونظم الشعر فلها نماذج Fanar-2 منفصلة.

Fanar-1-9B

QCRI / HBKU

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىخليجيشاميمصريaren

النموذج اللغوي العربي السيادي لقطر. هذا النموذج التعليماتي بحجم 8.7 مليار معامل، وهو فرع Prime، يواصل التدريب المسبق لنموذج google/gemma-2-9b على تريليون رمز عربي وإنجليزي، في حين دُرِّب نموذج Star المنفصل بحجم 7 مليارات معامل من الصفر. وتذكر البطاقة دعم الفصحى الحديثة إضافة إلى اللهجات الخليجية والشامية والمصرية، ومواءمة النموذج مع القيم الإسلامية والثقافة العربية.

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىaren

أول نموذج عربي ضمن سلسلة Falcon (مايو 2025)، بُني على Falcon3-7B بتوسيع المُرمِّز بـ32 ألف رمز عربي والتدريب على بيانات عربية غير مترجمة. أبقاه معهد TII مغلقاً: فلا أوزان منشورة تحت حساب tiiuae، وإنما مجموعات بيانات التقييم فقط، ويُستخدم النموذج عبر chat.falconllm.tii.ae. ويذكر الإعلان دعم الفصحى الحديثة إضافة إلى «لهجات رئيسة» غير مسمّاة.

Jais 2

Inception / Cerebras / MBZUAI

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىaren

خليفة عائلة Jais، صدر بأوزان مفتوحة في أغسطس 2026 بحجمَي 8 و70 مليار معامل للمحادثة، إضافة إلى نسخ GGUF. تذكر بطاقة النموذج أنه يغطي الفصحى الحديثة واللهجات الإقليمية والتناوب اللغوي بين العربية والإنجليزية دون تسمية تلك اللهجات. والمستودعات مقيَّدة بموافقة على مشاركة بيانات التواصل.

Jais 30B

Inception (Core42) / MBZUAI / Cerebras

نموذج لغوي
لا توجد تقييمات بعد
العربية: دعم كاملالفصحىaren

عائلة نماذج لغوية عربية مفتوحة بارزة تتراوح من 590 مليون إلى 70 مليار معامل، دُرِّبت على منظومة Condor Galaxy من Cerebras. أُعيدت تسمية حساب inceptionai إلى inception42، ولذلك لا يصل الرابط القديم إلا عبر إعادة توجيه؛ والمستودع مقيَّد بموافقة على مشاركة بيانات التواصل ولم يُحدَّث منذ سبتمبر 2024. وقد حلّ Jais 2 محله عملياً.