نماذج الذكاء الاصطناعي مختبرة للعربية
هل يعمل فعلاً مع اللهجة السعودية أو النجدية أو الحجازية أو الخليجية؟ نادرًا ما تجيب المعايير القياسية. المجتمع يختبر هذه النماذج على كلام ونصوص حقيقية — ويشارك النتائج.
CAMeLBERT
CAMeL Lab, NYU Abu Dhabi
نماذج BERT مُدرَّبة مسبقاً لكل نوع من أنواع العربية (الفصحى الحديثة والعامية والتراثية) لاستخراج الكيانات وتصنيف أقسام الكلام وتحليل المشاعر وتمييز اللهجات. وتبقى نسخة mix المدخل الأكثر استخداماً رغم أنها تعود إلى عام 2021.
AraBERT
AUB MIND Lab
أول مُرمِّز BERT عربي، وما زال المرجع الأساسي في أعمال معالجة اللغة العربية. وقد صارت بطاقة النموذج الأصلي bert-base-arabert تشير إلى أن نسخة أحدث حلّت محلها، ولذلك يشير هذا السجل إلى AraBERT v0.2 base، وهي النسخة الأكثر تنزيلاً والمدرَّبة على 77 غيغابايت من النصوص العربية. ولا تذكر بطاقة النموذج ولا مستودع aub-mind/arabert على GitHub أي رخصة.