From Manuscript to Searchable Text: A Computational Pipeline for Unlocking the PaganTibet Corpus

Du manuscrit au texte interrogeable : un pipeline computationnel pour l’exploration du corpus PaganTibet Conférence en Anglais par Raphael Griffiths, chercheure postdoctorante à l’EPHE – Université PSL, CRCAO sur zoom à 17H30

Le projet PaganTibet étudie les traditions religieuses conservées dans un corpus largement inexploré de plus de 100 000 pages manuscrites, dont la plupart n’existent aujourd’hui que sous forme d’images numérisées. Peu de chercheurs s’y sont penchés, en raison des difficultés que posent l’écriture, la langue et les concepts qui y sont véhiculés.

 Cette communication présente le pipeline computationnel que développe le projet PaganTibet afin de rendre ce corpus accessible à l’analyse : depuis la reconnaissance d’écriture manuscrite (HTR), qui transcrit les images de manuscrits en texte exploitable par machine, jusqu’aux méthodes de traitement automatique du langage naturel (TALN) permettant d’annoter et d’analyser ces textes. Les avancées récentes dans le domaine des humanités numériques permettent aux méthodes d’apprentissage profond de détecter automatiquement des thèmes, des motifs récurrents et d’autres caractéristiques du contenu, nous aidant ainsi à organiser et à classer des textes dont le contenu demeure, pour l’essentiel, encore inconnu. L’un des principaux résultats attendus du projet sera un catalogue de la collection, destiné à présenter et à mieux comprendre le contenu du corpus, et à poser les jalons nécessaires à la reconstruction de la nature de la religion païenne du Tibet.