معالجة العربية ولهجاتها
مجموعات بيانات ونماذج تفهم العربية كما تُكتب فعلًا على الإنترنت، بلهجاتها وطرائق كتابتها وتناوبها بين اللغات.
- تمييز اللهجات
- لغات قليلة الموارد
- العربيزي
حاليًا: زميلة زائرة في مركز المجتمع الرقمي (2026–2027)
أستاذة مشاركة في اللسانيات الحاسوبيةجامعة المشرق، عمّان
أدرس كيف يُشكّل الإعلام الناطق بالعربية وأنظمة الذكاء الاصطناعي ما يصدّقه الناس، وأكتب عن ذلك لقرّاء خارج أسوار الأكاديميا.
البحث
يقع عملي بين علوم الحاسوب والإنسانيات: أبني أدوات للغة العربية، وأسأل لمن تُبنى هذه الأدوات.
مجموعات بيانات ونماذج تفهم العربية كما تُكتب فعلًا على الإنترنت، بلهجاتها وطرائق كتابتها وتناوبها بين اللغات.
كيف تنتشر الادعاءات الزائفة عبر المنصات الناطقة بالعربية، ولماذا تُخفق أدوات الكشف المدرّبة على الإنجليزية في رصدها.
تدقيق تقنيات اللغة بحثًا عن التحيّز، والمساهمة في سياسات لا تجعل العالم الناطق بالعربية أمرًا ثانويًا.
مناهج حاسوبية لقراءة الصحف العربية التاريخية وحفظ السجل الرقمي للمنطقة.
الكتابة
نصوص مطوّلة لقرّاء خارج أسوار الأكاديميا.
يتحدث العربية أكثر من 400 مليون إنسان، لكن العربية التي تتعلمها معظم أنظمة الذكاء الاصطناعي لغةٌ لا يكاد أحد يتحدثها في بيته. ولهذه الفجوة عواقب.
قراءة في 9 دقائق

تتبّعنا ادعاءً صحيًا زائفًا واحدًا عبر 340 مجموعة محادثة. تكشف رحلته لماذا يصل التصحيح متأخرًا في أغلب الأحيان.
قراءة في 7 دقائق
عاشت فصول كاملة من تاريخ المنطقة القريب على مدوّنات ومنتديات لم تعد موجودة. وتقرير ما يُحفظ منها فعلٌ سياسي.
قراءة في 8 دقائق
«الذكاء الاصطناعي يتفوّق على الأطباء». «النموذج يفهم اللغة». خمسة أسئلة تطرحها قبل أن تشارك الاكتشاف القادم.
قراءة في 6 دقائق
المنشورات
أعمال محكّمة حديثة. القائمة الكاملة متاحة للبحث في صفحة الأبحاث.
2026
L. Haddad, O. Nasser, J. Kim
Journal of Computational Media Studies, 12(2)
Misinformation classifiers for Arabic are overwhelmingly trained on Modern Standard Arabic, yet most viral claims circulate in dialect. We introduce a benchmark of 38,000 fact-checked claims across nine dialect groups and show that dialect-aware pre-training reduces false negatives by 31% relative to strong multilingual baselines.
2025
L. Haddad, S. Benali, R. Aziz, M. Farouk
Proceedings of the Arabic NLP Conference (ArabicNLP 2025)
We describe the design and first release of LAHJA, a 12-million-word corpus of dialectal Arabic contributed by 4,100 volunteers with explicit, revocable consent. We detail our collection protocol, annotation scheme, and baseline results for dialect identification and sentiment analysis.
2025
ل. حدّاد، ع. الخطيب
مجلة اللسانيات العربية الحاسوبية، المجلد 7، العدد 1
تقيس هذه الدراسة أداء خمسة نماذج لغوية كبيرة على مهام الفهم والتوليد بخمس لهجات عربية، وتُظهر فجوة في الأداء تصل إلى 24 نقطة بين الفصحى واللهجات المغاربية. نقترح إطارًا للتقييم العادل بين اللهجات ونناقش أثره على الخدمات الرقمية الحكومية.
2024
L. Haddad, T. Ofori, D. Mansour
Proceedings of the ACM Conference on Fairness in Computing (FairComp '24)
Using 60,000 paired posts, we measure how automated moderation systems treat equivalent content written in English, Modern Standard Arabic, and Levantine Arabic. Dialectal posts were removed at 2.3× the rate of their English equivalents, with disproportionate impact on news and advocacy accounts.
ظهرت مقالاتي وتعليقاتي في
النشرة البريدية
مقال واحد مكتوب بعناية كل شهر، مع ملاحظات عن أبحاث جديدة تستحق وقتك. يمكنك إلغاء الاشتراك متى شئت.