Documenter ses données

La documentation des données renvoie à un ensemble de pratiques d'organisation, de structuration, de description et de communication de ses matériaux de recherche et de leur contexte de production. Documenter ses données constitue une étape essentielle d'un projet de recherche, permettant de les préserver, les réutiliser et les partager. Ces pratiques s'inscrivent au sein des préconisations FAIR qui œuvrent à rendre les données de recherche Faciles à trouver, Accessibles Interopérables et Réutilisables. L'ensemble de ces pratiques de documentation FAIR permet de renforcer la découverte et la réutilisation de ses données de recherche, et participe ainsi à la mise en œuvre d'une recherche éthique et reproductible.

Les ressources sélectionnées par l’équipe de CoDataSorb vous permettront de comprendre, pas à pas, comment documenter vos données de recherche pour renforcer leur préservation, leur réutilisation et leur partage selon les préconisations des principes FAIR.

Grâce à ces ressources, vous serez en mesure d'appliquer les recommandations en matière d'organisation de vos fichiers de données (plan de classement, arborescence hiérarchisée, nommage). Vous serez également aptes à prendre en main les outils de description de vos jeux de données, notamment les métadonnées reconnues dans votre discipline comme les standards et vocabulaires contrôlés, ou encore d'autres outils documentaires tels que les fichiers README. Des préconisations, pratiques et outils de documentation vous sont également proposés selon vos corpus de recherche et vos données (données textuelles, statistiques, images, sonores et linguistiques). 

Vous pourrez aussi poursuivre votre autoformation via des sites de références ou encore solliciter des personnes-ressources pour vous accompagner au mieux dans la documentation de vos données de recherche.

Organiser ses données de recherche

Un ensemble de bonnes pratiques d'organisation, de nommage et plus généralement de structuration des fichiers permet tout à la fois de réduire les risques de perte de données et de gagner du temps pour retrouver et réutiliser ses données ou celles d'autres chercheurs. Constituant un aspect essentiel pour la reproductibilité de la recherche, l'organisation des données est une part intégrante des principes FAIR et plus généralement d'une gestion vertueuse de ses données de recherche.

Les ressources sélectionnées par l’équipe de CoDataSorb vous permettront de comprendre les enjeux, recommandations et outils permettant de renforcer l'organisation de vos données de recherche. 
 

Décrire et communiquer ses données de recherche

Décrire ses données de recherche et rendre leur contexte de création compréhensible et explicite constituent une étape de documentation essentielle d'un projet de recherche, afin de pouvoir préserver ses données, les réutiliser ou encore les partager auprès de ses pairs. La description des données de recherche peut prendre différentes formes documentaires, parmi lesquelles les métadonnées, qui permettent de vous inscrire dans des pratiques disciplinaires communes et d'ainsi renforcer la découverte et la réutilisation de vos données de recherche par vos pairs. D'autres outils documentaires complètent les métadonnées, à l'instar des fichiers README. Par ailleurs, la mise à disposition des données de recherche est concomitante du format de fichiers, un sujet déterminant pour renforcer le potentiel de réutilisation de vos données.

Les ressources sélectionnées par l’équipe de CoDataSorb vous permettront de comprendre les modalités de description des données à votre disposition (métadonnées, standards, schémas, vocabulaires contrôlés, README) ainsi que les modalités de communication des fichiers de données (formats), qui constituent un enjeu de documentation central dans la gestion vertueuse de vos matériaux de recherche. 

  • Les métadonnées, un outil de description des données de recherche essentiel

    Les métadonnées désignent "un ensemble d'informations structurées qui décrit, explicite et localise une ressource informationnelle, dans le but d'en faciliter la recherche, l'usage et la gestion". Plusieurs types de métadonnées existent : les métadonnées embarquées, directement intégrées dans les fichiers de données eux-mêmes (informations techniques et contextuelles), et les métadonnées externes, ajoutées aux fichiers de données (titre, auteur, date de création, conditions d'accès, mots-clés...). Parce qu'elles sont garantes de la réutilisabilité et de la pérennité des jeux de données, les métadonnées occupent un rôle central pour la découverte, le partage et la réutilisation des données.

    Citation et texte adapté issus de la définition proposée par le Collège Données de la recherche du Comité pour la science ouverte "Faciliter la documentation des données grâce aux métadonnées dans un projet de recherche"

    DoRANum, "La minute Métadonnées"
    En moins de 3 minutes, cette brève vidéo de l'Inist-CNRS propose une introduction aux métadonnées : définition, enjeux, standards et outils à disposition de la communauté de recherche. 

    DoRANum, "Cours introductif sur les métadonnées"
    Ce guide interactif de l'Inist-CNRS propose une introduction des principales notions et outils essentiels entourant les métadonnées : définition et enjeux, différences de types de métadonnées (enrichies et embarquées), standards et schémas de métadonnées, enrichissement par des vocabulaires contrôlés.

    Blog de l'Institut Pasteur, "Documenter ses données par des métadonnées tout au long de son projet : une check-list pour ne rien oublier"
    L'Institut Pasteur met à disposition sur son blog un article synthétique autour de l'importance des métadonnées tout au long de son projet de recherche. Plusieurs étapes du cycle de vie des données sont ainsi passées en revue, en insistant sur le rôle des métadonnées pour chacune d'entre elles. Cet article est une synthèse du guide-checklist "Faciliter la documentation des données grâce aux métadonnées dans un projet de recherche" conçu par le collège Données de la recherche du Comité pour la science ouverte, qu'il est recommandé de consulter pour bénéficier de l'entièreté des préconisations.

    Urfist Méditerranée, "Les métadonnées sont partout ! Focus sur les métadonnées embarquées"
    L'Urfist Méditerranée met à disposition un guide sur les métadonnées embarquées, leurs avantages et les risques qu'elles comportent. Ces données encodées dans les fichiers eux-mêmes contiennent de nombreuses informations sur les caractéristiques du document, y compris des métadonnées sensibles pour lesquelles la mise en place de mesures de sécurité est essentielle. 

    Les standards de métadonnées

    Les standards de métadonnées permettent de mobiliser les métadonnées qui sont couramment utilisées pour chaque discipline et qui sont adoptées comme modèle reconnu et normalisé par les communautés de recherche. Constitués de différents schémas, ces standards favorisent la réutilisation et l'interopérabilité des données de recherche, en conformité avec les principes FAIR. 
    Des répertoires de standards disciplinaires existent afin d'identifier les standards de métadonnées reconnus dans votre discipline, tels que ceux de FAIRsharing, de Digital Curation Centre (DCC) et de Research Data Alliance (RDA). Afin de faciliter ces recherches, les standards peuvent être classés par disciplines : "Social Sciences" et "Art and Humanities".

    DoRANum, "Les schémas de métadonnées"
    En moins de 5 minutes, la vidéo de l'Urfist Méditerranée propose une introduction aux schémas de métadonnées, soit les normes structurant les différents standards de métadonnées. Ces schémas de métadonnées sont constitués par des listes d'éléments descriptifs reliés entre eux et sont définis par diverses caractéristiques structurantes. 
     

    Les vocabulaires contrôlés

    Les vocabulaires contrôlés désignent des lexiques normalisés (tels que des thésaurus, listes, ontologies...) couramment utilisés par les communautés scientifiques disciplinaires. Ils permettent d'enrichir les métadonnées au moment du dépôt des données dans un entrepôt, et de renforcer ainsi leur visibilité et réutilisation.

    Loterre, répertoire de vocabulaires contrôlés 
    Istex Loterre (Linked open terminology resources) est un répertoire de vocabulaires contrôlés classés par disciplines, dont les SHS.

    Outils d’aide à la saisie des métadonnées

    Des outils facilitant la saisie des métadonnées sont mis à disposition pour la communauté scientifique (générateur, checklist).

    DoRANum et le générateur de métadonnées "DataCite Metadata Generator"
    DoRANum met à disposition un générateur de métadonnées pour les données de recherche, en suivant le schéma de DataCite, un standard utilisé pour l'attribution d'identifiants pérennes Digital Object identifier (DOI).

    Collège Données de la recherche du Comité pour la science ouverte et sa cheklist "Faciliter la documentation des données grâce aux métadonnées dans un projet de recherche"
    Ce guide-checklist propose un ensemble de préconisations tout au long des étapes du cycle de vie des données (objectifs, acteurs concernés, actions). 

    Pour aller plus loin sur les métadonnées

    Quelques ressources complémentaires sur les métadonnées.  

    DoRANum, "Métadonnées, standards, formats - Comment décrire les données ?"
    DoRANum met à disposition un vaste répertoire de ressources à explorer sur les métadonnées : fiche synthétique, vidéos, guide, autoévaluation pour tester ses connaissances...

    DARIAH et le service Vocabs autour de la création, la maintenance et l'utilisation de vocabulaires contrôlés en ALL-SHS
    À destination de la communauté ALL-SHS, le service Vocabs de DARIAH (Digital Research Infrastructure for the Arts and Humanities) permet de parcourir des vocabulaires contrôlés publiés sur la plateforme (Vocabs browse) mais aussi d'en créer et d'en éditer de manière collaborative (Vocabs editor).

    CLARIN et son répertoire de domaines d'application des standards par sujet 
    L'infrastructure européenne CLARIN consacrée au partage de ressources et d'outils autour du langage met à disposition une liste de domaines d'application des standards de métadonnées. 

    CLARIN et son répertoire de métadonnées par champ disciplinaire
    CLARIN propose un répertoire de métadonnées par champ disciplinaire. 

    DARIAH et son catalogue d'outils et de services
    L'infrastructure européenne DARIAH à destination des disciplines ALL-SHS met à disposition un ensemble de services, d'outils et de ressources (volets "core services" et "community services"), notamment autour de la documentation des jeux de données. 

  • Décrire le contexte et l’organisation de ses données : fichiers README et autres outils documentaires

    Fichiers README

    En plus des métadonnées, d'autres modalités et outils documentaires sont disponibles pour mettre en œuvre la description des données de recherche, de leur contexte de production et de leur organisation, à l'instar des fichiers README (ou "Lisez-moi"). Préconisés dans les pratiques FAIR, les fichiers README sont pensés comme un complément des métadonnées et permettent dès lors de renforcer encore davantage la découverte et la réutilisation de vos jeux de données. 

    Recherche Data Gouv, "Modèle de README"
    Recherche Data Gouv met à disposition un modèle de README, conçu pour aider à structurer la documentation de vos données de recherche.

    Les autres outils documentaires pour décrire l’organisation de vos données

    En plus des fichiers README, d'autres documents conçus et utilisés pour gérer vos données de recherche peuvent aussi être employés et pensés comme de véritables outils de documentation : le plan de gestion de données documentant les différentes étapes de votre projet, ou encore le cahier de laboratoire (ou carnet de recherche) décrivant la méthodologie et les résultats tout au long de votre projet. Ces différents documents décrivent vos données en les contextualisant et en donnant toute information nécessaire à leur compréhension.

    Texte adapté de l'article du blog de l'Institut Pasteur "Comment décrire ses données pour les rendre compréhensibles et réutilisables ?"
     

  • Les formats de fichiers de données

    La communication des jeux de données se concrétise par l'utilisation de formats de fichiers, et particulièrement les formats ouverts comme préconisés dans les pratiques FAIR. Appliquer un format de fichier ouvert et adapté pour vos types de document est essentiel pour renforcer le partage et la réutilisation de vos données. 

    L'Urfist Méditerranée et l'Inist-CNRS proposent une fiche synthétique sur les formats ouverts et fermés (définitions, enjeux, alternatives aux formats fermés).

    L'Urfist Méditerranée et l'Inist-CNRS mettent à disposition un tableau comparatif des formats ouverts et fermés par type de document (texte, image, tableau, vidéo, audio, présentation, archivage, dessin). La diversité des formats ouverts démontre qu'il existe de nombreuses alternatives ouvertes face aux formats propriétaires.

    DoRANum, "Quiz : Format ouvert ou fermé ? Testez vos connaissances des formats de fichiers"
    L'Urfist Méditerranée et l'Inist-CNRS proposent un article synthétique accompagné d'un quiz pour tester ses connaissances sur les formats de fichiers.

    INRAE, "Choix des formats de fichiers"
    Pour aller plus loin, consulter aussi la page sur le choix des formats de fichiers de l'INRAE, relayant notamment les listes réalisées par la Library of Congress sur les formats par types de fichiers. Cette liste peut vous aider dans le choix du format adapté à votre projet de recherche. 

Documenter les données textuelles

Plusieurs standards de métadonnées sont reconnus et appliqués pour les données textuelles en sciences humaines et sociales, permettant de documenter et contextualiser les données de recherche, et d'œuvrer ainsi à les rendre FAIR (Faciles à trouver, accessibles, interopérables, réutilisables). Plusieurs facteurs orientent le choix du standard : "le type de ressources décrites, le domaine scientifique dont sont issues les données, la communauté concernée par la production des données, l'entrepôt choisi pour stocker les données"*.

Les standards de métadonnées reconnus et les plus couramment utilisés en sciences sociales pour les données textuelles sont le Dublin Core (DC) et la Text Encoding Initiative (TEI), ainsi que la Data Documentation Initiative (DDI) pour les données statistiques (consulter la partie "Documenter ses données statistiques" pour plus d'informations).

Des outils et logiciels spécifiquement dédiés au traitement et à l'analyse des données textuelles peuvent être consultés dans la rubrique "Analyser ses données".


*Citation de la page "Documenter ses données" de l'Université Rennes 2

  • Documenter ses données textuelles : les ressources essentielles

    Le standard de métadonnées Dublin Core (DC)

    Le Dublin Core, standard de métadonnées, propose un "socle commun d'éléments descriptifs"* qui peuvent s'adapter à plusieurs types de données. Ce standard est utilisé pour décrire les données SHS, notamment lors d'un dépôt dans l'entrepôt de données Nakala. 15 propriétés de base composent le Dublin Core, auxquelles s'ajoutent 3 autres propriétés dans le cas du Dublin Core qualifié (variante enrichie).

    *Citation de l'article Wikipédia

    Texte adapté de la page "Documenter ses données" de l'Université Rennes 2
     

    Site officiel du standard Dublin Core (DC)
    Site officiel du standard de métadonnées Dublin Core (présentation, actualités, ressources).

    Inria et sa vidéo "Dublin Core pour les documents"
    En quelques minutes, cette courte vidéo de l'Inria revient sur la définition du Dublin Core et ses propriétés, ainsi que sur l'analyse d'un exemple de description.

    Le standard de métadonnées Text Encoding Initiative (TEI)

    La Text Encoding Initiative (TEI) est un "langage de description des textes en milieu numérique"*. En tant que langage de structuration de données textuelles (en XML), la TEI permet aussi de "saisir des métadonnées associées aux textes". Ce format de balisage est reconnu dans les humanités numériques, et permet d'encoder des ressources numériques, en particulier les documents textuels pour les disciplines SHS.

    * Citations extraites de la page "Documenter ses données" de l'Université Rennes 2
     

    Site officiel de la Text Encoding Initiative (TEI)
    Site officiel du langage de structuration des données textuelles TEI (présentation, actualités, ressources).

    GRICAD, "Manuel général de TEI"
    Proposé par l'Unité d'appui et de recherche GRICAD (Grenoble Alpes Recherche, Infrastructure de Calcul Intensif et de Données), ce manuel revient sur différents aspects autour de la TEI : organisation d'un projet d'édition numérique, informations sur le XML, sur la grammaire spécifique du XML et de la TEI. 

    Projet Textométrie, "Tutoriel d’importation de corpus TEI"
    Ce tutoriel proposé par le Projet Textométrie permet de créer un corpus TXM à partir d'un document XML encodé en TEI.   

    Urfist de Bordeaux et son tutoriel "Initiation XML-TEI"
    L'Urfist de Bordeaux met à disposition un tutoriel d'initiation à XML-TEI, proposant des aspects théoriques et pratiques (exercices corrigés, exemples, etc).

    Consortium TEI et son répertoire de ressources en autoformation sur la TEI
    Pour aller plus loin sur ce sujet, le consortium TEI propose une liste de ressources pour s'autoformer sur la TEI (tutoriels généralistes, guides d'application). 

    DARIAH et son tutoriel sur la TEI
    Pour aller plus loin sur la TEI, l'infrastructure européenne DARIAH à destination des disciplines ALL-SHS met à disposition un tutoriel sur la TEI (supports en allemand). 

    Data Documentation Initiative (DDI), le standard de métadonnées pour les données d’enquête et données statistiques

    La Data Documentation Initiative (DDI) est un standard de métadonnées pour les données en sciences sociales, économiques, comportementales, et plus particulièrement adapté pour les données statistiques et les données issues d'enquêtes. 
    Pour plus d'informations, consulter la partie suivante "Documenter les données statistiques". 
     

    Site officiel du standard Data Documentation Initiative (DDI)
    Site officiel du standard de métadonnées DDI (présentation, actualités, ressources).

Documenter les données d’enquête et les données statistiques

Essentielle pour contextualiser ces données et œuvrer à les rendre FAIR, la documentation des données statistiques et des données d'enquête comporte des singularités, parmi lesquelles les normes et standards de métadonnées reconnus et couramment utilisés : vocabulaires contrôlés, nomenclatures ou encore standard de métadonnées (Data Documentation Initiative (DDI))... adaptés pour décrire ce matériau de recherche.

Des outils et logiciels spécifiquement dédiés au traitement et à l'analyse des données statistiques et d'enquêtes (R, Python, etc) peuvent être consultés dans la rubrique "Analyser ses données". 
 

  • Documenter ses données d‘enquête et ses données statistiques : les ressources essentielles

    Quelques ressources pour comprendre les enjeux de la documentation des données statistiques : objectifs, pratiques, recommandations.

    CDSP, Adisp, "Pourquoi et comment documenter ses données ?"
    Ce support de présentation conçu par les Archives de données issues de la statistique publique (Adisp) et le Centre de données socio-politiques de SciencesPo (CDSP) propose une introduction aux enjeux de la documentation des données issues de la statistique publique. Sont ainsi présentés les enjeux de la documentation des données qualitatives et quantitatives, les manques couramment identifiés par type de données, ainsi que les difficultés à anticiper. 

    Insee, "Statistiques fondées sur des données administratives : Esquisse d’un cadre général"
    Proposé par l'Insee, ce document de travail détaille les enjeux de la (ré)utilisation des données issues de la statistique publique, y compris du point de vue de leur description et de leur documentation (voir notamment : "La phase d'acquisition : vers une source administrative qualifiée" (partie 4), "La phase de transformation : passer du monde administratif au monde statistique" (partie 5)).
     

    Vocabulaires contrôlés, dictionnaires et nomenclatures

    Plusieurs normes reconnues et couramment utilisées sont à votre disposition pour vous accompagner dans la description des données statistiques et des données d'enquête : vocabulaires contrôlés, dictionnaires, nomenclatures.

    Progedo, "Vocabulaires contrôlés acceptés par Quetelet-Progedo"
    Ce document de synthèse présente les vocabulaires contrôlés acceptés par le catalogue Quetelet-Progedo pour ses métadonnées (pour plus d'informations sur ce catalogue permettant d'accéder aux données d'enquêtes publiques, consulter la rubrique "Collecter des données"). 

    Loterre, " Vocabulaire des sciences administratives"
    Différents vocabulaires contrôlés thématiques et disciplinaires peuvent être mobilisés pour renseigner les métadonnées, à l'instar de celui de Loterre pour les sciences administratives.

    Insee, "Nomenclatures statistiques françaises des domaines économique et social"
    L'Insee met à disposition "les principales nomenclatures statistiques françaises des domaines économique et social", pouvant vous aider dans la documentation de vos données. 

    Insee, "Dictionnaire des définitions des concepts"
    L'Insee propose un dictionnaire intégrant les "définitions des concepts les plus souvent utilisés" pour la statistique publique, pouvant vous aider dans la documentation de vos données. 

    Data Documentation Initiative (DDI), le standard de métadonnées pour les données d’enquête et les données statistiques

    La Data Documentation Initiative (DDI) est un standard de métadonnées reconnu et utilisé pour les données en sciences sociales, économiques, comportementales. Ce standard est mobilisé pour les données statistiques et données issues d'enquêtes. De nombreuses structures pourvoyant des données statistiques utilisent ce standard et les vocabulaires contrôlés associés (Progedo, Insee, Cessda, etc), standard qu'il est donc important d'appréhender pour ce type de données de recherche. 

    Site officiel de la Data Documentation Initiative (DDI)
    Site officiel du standard de métadonnées DDI pour les données issues de la statistique publique (présentation, actualités, ressources).

    Wikipédia, "Data Documentation Initiative"
    Cet article Wikipédia présente le standard DDI, ses spécifications, son déploiement. 

    Mate-SHS et le webinaire Tut@MATE du CDSP, "DDI, un standard de documentation des données"
    Dans le cadre des Tut@MATE du réseau Mate-SHS, le Centre de données socio-politiques de SciencesPo (CDSP) met à disposition le webinaire vidéocapté d’une heure dédiée à la Data Documentation Initiative, suivi d'échanges (45 minutes). Sont ainsi abordés la présentation du standard du DDI et des normes de documentation des données d'enquête, ainsi que les logiciels pour gérer les métadonnées DDI (Nesstar, Sledgehammer, Colectica). Le support de présentation est téléchargeable sur la page. 

    DDI, "Les vocabulaires contrôlés reconnus et utilisés dans le standard DDI"
    L'Alliance DDI propose une liste de vocabulaires contrôlés reconnus et utilisés pour ce standard de métadonnées. Parmi les termes listés dans ces vocabulaires contrôlés (anglais) : Aggregation Method, Data Type, Software Package, Data Source Type, Mode of Collection, etc. 

Documenter les images : description et formats

La documentation et la description des images comme matériau de recherche comportent des singularités (outils, formats). Par ailleurs, des implications spécifiques en matière de propriété intellectuelle peuvent s'appliquer plus particulièrement à ce type de données, l'accès ouvert et libre à des bases de données d'images ne signifiant pas l'absence d'encadrement dans leur traitement (par exemple Gallica est ouvert et libre mais la collecte automatisée en ligne (scrapping) est encadrée). De plus, il est essentiel d'être vigilant à l’application de mesures de protection des données, particulièrement lorsqu'il s'agit d'images impliquant des personnes vivantes. 

Documenter les données linguistiques et sonores

La documentation et la description des données sonores et linguistiques comme matériau de recherche comportent des singularités (outils, formats). Par ailleurs, des implications spécifiques en matière de propriété intellectuelle et de protection des données peuvent s'appliquer plus particulièrement à ce type de matériau de recherche, la captation de la voix étant une donnée (ré)identifiante. 
Les logiciels conçus pour la documentation des données linguistiques et sonores (description, annotation, édition) participent aussi activement à leur analyse. Des outils spécifiquement dédiés au traitement et à l'analyse des données sonores et linguistiques peuvent également être consultés dans la rubrique "Analyser ses données". 

Contacts

L’Atelier de la donnée CoDataSorb 

Une seule adresse mail générique à retenir pour contacter CoDataSorb, l'Atelier de la donnée de Sorbonne Alliance : codatasorb@sorbonne-alliance.fr

Les Plateformes universitaires de données (PUD)

Les Plateformes universitaires de données (PUD) peuvent vous accompagner dans la documentation des données quantitatives ("données issues de la statistique publique, grandes enquêtes nationales et internationales notamment"), et plus généralement sur leur utilisation et sur les "méthodes d’analyse quantitatives, afin de contextualiser, d’enrichir et de conduire leurs analyses de recherche"*.
*MSH Mondes, "Plateforme universitaire de données"