Ressources numériques en sciences humaines et sociales OpenEdition Nos plateformes OpenEdition Books OpenEdition Journals Hypothèses Calenda Bibliothèques OpenEdition Freemium Suivez-nous

DistamLAB #1: Annotation, Structuration et Textes Arabes

Mardi 24 février 2026 s’est tenue la première séance du DistamLAB, séminaire transversal réunissant les membres porteurs de projet du consortium.

Ce premier distamLAB a été animé par : 

  • Noëmie Lucas, chercheuse en histoire islamique à l’Institut français du Proche-Orient depuis décembre 2025, co-coordinatrice du CST-HN distam+ depuis janvier 2026 ;
  • Marie Bizais-Lillig, maîtresse de conférences et directrice du département d’études chinoises à l’Université de Strasbourg, ainsi que co-coordinatrice du CST-HN distam+, qui était la discutante interne. Ses recherches portent sur la poésie et la poétique chinoises médiévales. Au sein de distam+, elle porte le projet cœur Chi-Know-Po.
  • Till Grallert, historien de la société et des médias de la Méditerranée orientale arabophone du XIXe siècle à nos jours, qui avait accepté d’être le discutant externe. Il dirige le Methods Innovation Lab de NFDI4Memory au sein du département d’histoire de l’université Humboldt de Berlin depuis 2023. 

Présentation

Quel est le projet présenté ?

Le projet de recherche présenté « AKHBARIYYUN », explore les processus d’écriture de l’histoire des VIIIe et IXe siècles du monde islamique à travers l’étude de la littérature arabe composée entre le IXe et le XIIe siècle. Il s’intéresse particulièrement à la manière dont l’information historique (le khabar) a été transmise au fil du temps, de l’observation d’un événement à son intégration dans une œuvre narrative. Pour ce faire, le projet se concentre sur les « acteurs » de cette histoire (les akhbāriyyūn) et étudie la “fabrique” de ces récits depuis leur chaîne de transmission (isnād) jusqu’à l’information transmise (matn). L’objectif central est de mener une étude socio-historique inédite des transmetteurs des VIIIe et IXe siècles en tant que groupe social, tout en analysant leurs pratiques de composition. Pour en savoir plus, lisez le billet descriptif du projet cœur AKHBARIYYUN

Quelles sont les données utilisées ?

  • Type de données : Littérature composée en arabe du IXe au XIIe siècle traitant de la période allant du début de la dynastie marwanide (684) au califat d’al-Muqtadir (908-932). Cela inclut notamment des sources narratives historiques (histoires annalistiques, universelles), des dictionnaires biographiques et des sources littéraires (adab).
  • Liens avec d’autres données : Le projet s’appuie notamment sur les vastes corpus numériques mis à disposition par l’initiative OpenITI (Open Islamicate Texts Initiative) et le projet KITAB. 
  • Entrepôt : Le projet étant à ses débuts, les données ne sont pas encore déposées, mais l’un des objectifs finaux est la publication de jeux de données annotés selon des standards réutilisables.

Quels sont les objectifs du projet ?

  • Contributions scientifiques : Améliorer la compréhension des transmetteurs des VIIIe et IXe siècles (un groupe social encore peu étudié) ; mettre en lumière leurs pratiques de transmission et de composition ; et repenser la relation entre l’écriture de l’histoire et la notion de vérité dans les premiers siècles de l’islam.
  • Innovations méthodologiques : Tester les paradigmes académiques liés à l’historiographie islamique ; publier des jeux de données annotés ; évaluer la précision et le gain de temps offerts par les outils d’IA générative pour l’annotation ; et développer de nouveaux modèles (notamment pour le NLP) adaptés aux textes en arabe classique.

Quel est le thème, la question, le problème, l’enjeu discuté dans le DistamLAB en lien avec le projet ?

L’enjeu central discuté lors de ce DistamLAB est la structuration et l’encodage critique des textes arabes classiques. Face à l’absence de consensus sur les standards (TEI vs. Markdown), le problème est de trouver le système de balisage (tags) le plus pertinent pour répondre aux questions scientifiques du projet. L’enjeu est de réussir à encoder la chaîne d’attribution (isnād) non pas comme une structure statique séparée du récit, mais comme une fonction continue et relationnelle, capable de capturer les nuances complexes de l’arabe (comme les pronoms implicites) et les transmissions enchâssées (“l’histoire dans l’histoire”).

  • Quels sont les outils utilisés et quelle méthodologie a été mise en place ? Pour tester l’assistance à l’annotation, une méthodologie d’annotation automatisée a été mise en place à l’aide d’Intelligences Artificielles génératives (LLMs). Les versions premium de Gemini et Claude ont été utilisées en leur fournissant un “prompt” identique leur demandant d’identifier et de baliser (en XML) les isnāds d’un chapitre test (52 akhbār tirés du Kitāb al-Aghānī, soit la notice biographique consacrée à Khālid al-Qasrī, gouverneur d’Iraq au VIIIe siècle).
  • Quels sont les résultats de ces tests/traitements ? Gemini a largement surpassé Claude, parvenant à identifier presque tous les isnāds, même les plus courts. Cependant, le test a mis en évidence un biais chez ces LLMs : probablement entraînés sur la littérature du hadith (qui sépare strictement isnād et matn), ils peinent à délimiter le début et la fin exacts de la chaîne, ignorent les entités implicites (le “m'” de “il m’a rapporté”) et manquent totalement les transmissions imbriquées. Cela confirme la nécessité de développer un encodage sur mesure plutôt que de se fier uniquement à une extraction automatisée standard.
Test d’annotation Gemini sur un chapitre du Kitâb al-Aghânî

Quels sont les outils / méthodologies mentionnés/évoqués/testés/présentés dans le cadre de ce distamLAB ?

  • Standards d’encodage textuel : XML/TEI (utilisé par des projets comme BADR ou Open Arabic Periodical Editions) face aux systèmes de balisage léger comme le Markdown / mARkdown (développé pour OpenITI).
  • Outils d’Intelligence Artificielle (IA) : Les LLMs Gemini et Claude (testés pour l’annotation et l’extraction).
  • Outils numériques spécifiques : L’outil PASSIM développé par le projet KITAB (évoqué pour suivre la réutilisation des rapports transmis de génération en génération).
  • Méthodologies d’analyse : Étude prosopographique, analyse de réseaux (pour étudier les transmetteurs comme un réseau rhizomatique), analyse synchronique et diachronique, et approches computationnelles incluant le traitement du langage naturel (NLP arabe) et le Topic Modeling (pour les séquences historiographiques).

Le Lab réunissait deux discutants, Marie et Till, qui tout deux utilisent les standards de la TEI pour l’encodage de leurs textes, en chinois pour Marie et arabe pour Till. L’objectif de leur présence était qu’ils puissent apporter leur regard sur cette question des standards d’annotation pour les textes, en particulier arabe. 

Discussion

Les échanges entre les discutants et la présentatrice, ainsi qu’avec les autres participants, ont notamment porté sur les raisons de choisir la TEI et ses enjeux, à partir des retours d’expérience de Marie et Till et des questions posées par Noëmie. Les forces de la TEI sont manifestes: une grande communauté composée de personnes qui comprennent les textes et leur structuration dans une approche « language-agnostique », garantissant ainsi l’interopérabilité et la compréhension mutuelle. En outre, la documentation est très riche et de nombreux outils sont disponibles. L’automatisation du markup est par ailleurs possible notamment par l’utilisation d’expressions régulières. Il est aujourd’hui possible d’explorer l’utilisation de LLMs pour automatiser. Une limite, cependant, est de ne pas confondre XML et TEI. Les tags ne sont pas les mêmes. 

La question de la facilité et des limites liées à l’utilisation de ces standards pour l’arabe a été soulevée, et des solutions existantes ont été mises en avant. Till a notamment mentionné le travail de Soualah et Hassouna (« A TEI P5 Manuscript Description Adaptation for Cataloguing Digitized Arabic Manuscripts », 2012) portant sur l’encodage des noms en arabe. Plus largement, la discussion a notamment porté sur l’utilisation d’un standard occidental conçu pour l’annotation de textes du XXe siècle afin d’encoder des textes non occidentaux et non contemporains, porteurs d’un autre régime de vérité et de réalité. L’utilisation d’un standard comme celui de la TEI implique d’accepter un certain modèle de réalité conçu pour des besoins spécifiques. Ce qui compte est de faire en sorte que l’encodage permette une exploration computationnelle et, pour cela, le point central est celui de la constance. La TEI est une convention qu’il faut appréhender comme telle. 


OpenEdition vous propose de citer ce billet de la manière suivante :
nlucas (17 août 2026). DistamLAB #1: Annotation, Structuration et Textes Arabes. Carnet hypothèses du consortium Huma-Num distam+ (DIgital STudies Africa, Asia, Middle East). Consulté le 15 septembre 2026 à l’adresse https://doi.org/10.58079/16nzp


Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

This site uses Akismet to reduce spam. Learn how your comment data is processed.