Durée : du 01/01/2023 au 31.12.2023

Éditions sous forme de données liées

Les éditions de textes scientifiques constituent un défi majeur en raison de divers facteurs liés à leur exploitation secondaire et transversale ainsi qu’à leur réutilisation. Celles-ci englobent aussi bien la compilation du contenu que l’analyse et la sauvegarde des données collectées. Parmi ces défis figurent :

  • les différentes orientations temporelles et géographiques des contenus de recherche
  • langues et niveaux linguistiques variés
  • systèmes d'écriture variés
  • Présentation sous différentes formes combinant le texte de l'édition, traduction, fac-similés, etc.
  • Les données numériques sont disponibles dans différentes architectures système et différents modèles de données
  • Variabilité des données collectées pendant la durée de l’édition « hot data » (Seul l’archivage à long terme des données après la fin du projet « cold data » garantit l’inaltérabilité des données.)

La mise à disposition à long terme des données de recherche constitue donc un élément essentiel de la recherche scientifique.

Le projet

Le projet « edition2LD » travaille à une solution de curation des données qui rende les données de recherche hétérogènes accessibles à long terme et au-delà des limites énumérées ci-dessus. Celle-ci doit être suffisamment flexible pour s'adapter à l'hétérogénéité des données et, en même temps, suffisamment stable pour s'inscrire dans une perspective à long terme. Pour cette solution, le projet edition2LD suit le paradigme des données liées (Linked Data, LD) et de l'intégration des données dans le Web sémantique.

Cas d’utilisation en tant que « meilleure pratique »

Afin d’élaborer le workflow pour la modélisation des données liées (LD), le projet choisit comme cas d’application les éditions du centre de recherche « Sources d’histoire des religions et du droit du Népal prémoderne » (Nepal-FS) de la HAdW. Ce centre de recherche produit des éditions numériques des textes népalais (en écriture devanagari), comprenant des fac-similés, des traductions en anglais (en caractères latins), des commentaires et des entrées de registre (personnes, lieux, termes techniques).

Les publications sont disponibles sur nepalica.hadw-hw.de et avec attribution d’un DOI sur les pages de la bibliothèque universitaire de Heidelberg (voir par exemple https://digi.hadw-bw.de/view/dna_0001_0005).

Édition numérique des « Sources d'histoire des religions et du droit du Népal prémoderne », nepalica.hadw-bw.de.

Approche

Le flux de travail pour la modélisation LD doit être suffisamment générique pour permettre une transposabilité future à d’autres projets. Parallèlement, il doit permettre – lorsqu’il est lancé de manière répétée – de convertir les données par lots au format RDF et ainsi de répondre au défi majeur que représentent les « données dynamiques ». Lors de l’élaboration des processus de mappage automatisés, il est donc extrêmement important de réduire au minimum l’étape de post-traitement manuel, idéalement de manière à ce qu’elle ne doive être effectuée qu’une seule fois.

Le projet se concentre sur la modélisation des entités d’information « texte », « traduction en anglais », entités nommées (noms de personnes et de lieux) et de la terminologie spécialisée, ainsi que sur les métadonnées. Pour la modélisation des entités nommées, le projet peut s’appuyer sur les entrées du registre Nepal-FS, qui contiennent pour certaines des références supplémentaires vers des référentiels de données normatives et des ressources encyclopédiques.

Entrée du registre concernant Pṛthvīnārāyaṇa Śāha, roi de Gorkha puis du Népal, dans nepalica.hadw-bw.de

Les vocabulaires, ontologies et référentiels utilisés pour la modélisation sont ceux déjà établis comme normes : RDFS, SKOS, Fichier commun des données normatives GND, VIAF, DBpedia, GeoNames, FOAF etc. De plus, la modélisation LD intègre des liens avec des instances de deux ontologies consacrées aux noms de personnes et de lieux historiques du Népal (NepalPeople et NepalPlaces, cf. Tittel 2022*), élaborées à partir des données de recherche du projet Nepal-FS.

Les sources de données sont :

  1. la base de données du Nepal-FS
  2. fichiers contenant des informations complémentaires
  3. Informations intégrées dans le pipeline à partir des entrées du registre et du glossaire via l’exploration du Web
  4. Ontologies NepalPeople et NepalPlaces : des scripts Python comparent les données modélisées avec les entrées de NepalPeople et NepalPlaces et intègrent, le cas échéant, des liens vers leurs instances.
Pipeline de traitement des données à l'aide de scripts Python (état d'avancement : terminology.py ; NamedEntities.py), qui génèrent des données RDF à partir des données d’entrée provenant de différentes sources

À l’heure actuelle [septembre 2023], la modélisation des entités nommées et des termes est achevée à 90 % ; la modélisation des entités « Traduction en anglais », « édition népalaise » et des métadonnées est en cours.

Le projet « Modélisation des réseaux de connaissances dans la Roumanie médiévale à partir de bases de données linguistiques – ALMA » (lien interne), qui a été lancé le 1er août 2022 dans le cadre du programme des académies en tant que projet interacadémique de la HAdW, de la BAdW et de l’AdW de Mayence. Étant donné qu’ALMA élabore des éditions de textes (ici, des textes juridiques et médicaux médiévaux), ce corpus de données se prête également bien à une approche edition2LD.

Code Python

Publications

Svoboda-Baas, Dieta/Tittel, Sabine : Text+Plus, n° 04 : Modélisation des éditions de textes sous forme de données liées (edition2LD), dans : Blog Text+, 18 décembre 2023, https://textplus.hypotheses.org/8723.

*Tittel, Sabine. « Towards an Ontology for Toponyms in Nepalese Historical Documents », dans : Actes de l’atelier sur les ressources et les technologies pour les langues autochtones, menacées et disposant de peu de ressources en Eurasie, organisé dans le cadre de la 13e Conférence sur les ressources linguistiques et leur évaluation, Marseille, juin 2022, 2022, Marseille (Association européenne des ressources linguistiques – ELRA), p. 7-16.