Documenter ses données
La documentation des données renvoie à un ensemble de pratiques d'organisation, de structuration, de description et de communication de ses matériaux de recherche et de leur contexte de production. Documenter ses données constitue une étape essentielle d'un projet de recherche, permettant de les préserver, les réutiliser et les partager. Ces pratiques s'inscrivent au sein des préconisations FAIR qui œuvrent à rendre les données de recherche Faciles à trouver, Accessibles Interopérables et Réutilisables. L'ensemble de ces pratiques de documentation FAIR permet de renforcer la découverte et la réutilisation de ses données de recherche, et participe ainsi à la mise en œuvre d'une recherche éthique et reproductible.
Les ressources sélectionnées par l’équipe de CoDataSorb vous permettront de comprendre, pas à pas, comment documenter vos données de recherche pour renforcer leur préservation, leur réutilisation et leur partage selon les préconisations des principes FAIR.
Grâce à ces ressources, vous serez en mesure d'appliquer les recommandations en matière d'organisation de vos fichiers de données (plan de classement, arborescence hiérarchisée, nommage). Vous serez également aptes à prendre en main les outils de description de vos jeux de données, notamment les métadonnées reconnues dans votre discipline comme les standards et vocabulaires contrôlés, ou encore d'autres outils documentaires tels que les fichiers README. Des préconisations, pratiques et outils de documentation vous sont également proposés selon vos corpus de recherche et vos données (données textuelles, statistiques, images, sonores et linguistiques).
Vous pourrez aussi poursuivre votre autoformation via des sites de références ou encore solliciter des personnes-ressources pour vous accompagner au mieux dans la documentation de vos données de recherche.
Organiser ses données de recherche
Un ensemble de bonnes pratiques d'organisation, de nommage et plus généralement de structuration des fichiers permet tout à la fois de réduire les risques de perte de données et de gagner du temps pour retrouver et réutiliser ses données ou celles d'autres chercheurs. Constituant un aspect essentiel pour la reproductibilité de la recherche, l'organisation des données est une part intégrante des principes FAIR et plus généralement d'une gestion vertueuse de ses données de recherche.
Les ressources sélectionnées par l’équipe de CoDataSorb vous permettront de comprendre les enjeux, recommandations et outils permettant de renforcer l'organisation de vos données de recherche.
-
Organiser ses données : les ressources essentielles
L'organisation des données se concrétise sous la forme de plusieurs bonnes pratiques connexes, notamment l'application d'un plan de classement de dossiers avec arborescence hiérarchisée et l'utilisation des règles de nommage pour les fichiers de vos projets de recherche.
DoRANum, "Conseils pour l’organisation des données"
L'Inist-CNRS met à disposition un diaporama interactif sur l'organisation des données afin d'en faciliter leur (ré)utilisation tout au long du projet de recherche (arborescence des dossiers, nommage des dossiers et fichiers, avec exemples concrets).DoRANum, "Comment bien nommer ses fichiers ?"
L'Urfist Méditerranée et l'Inist-CNRS proposent un article synthétique sur l'importance du nommage des dossiers et des fichiers dans la gestion et la documentation de ses données (typologie des fichiers numériques et règles de nommage).Blog de l'Institut Pasteur, "Comment organiser et nommer ses données ?"
Cet article du blog de l'Institut Pasteur propose une synthèse des pratiques d'organisation et de nommage facilitant la réutilisation des données de recherche.Modèles de plan de classement
Différents modèles de plan de classement de dossiers pour des projets de recherche sont accessibles. Les templates sont développés pour servir d’inspiration et doivent être adaptés et retravaillés pour correspondre à vos besoins dans le cadre de votre projet de recherche.
Template téléchargeable d'un plan de classement pour un projet de recherche :"Folder structure template for research repositories (Colomb Julien, Thorsten Arendt, Keisuke Sehara, and The Gin-Tonic team)"
Des modèles préremplis de plan de classement des fichiers et données sont téléchargeables, à l'instar de ce template qui propose une arborescence hiérarchisée des fichiers d'un projet de recherche. Après le téléchargement du dossier dans lequel l'arborescence est déployée (dossiers et sous-dossiers, types de fichiers à faire figurer -READMe, licences...), ce template doit être retravaillé et ajusté comme pour tout autre modèle, afin de le faire correspondre à vos besoins dans le cadre de votre projet de recherche.Fiche pratique d'un modèle de plan de classement pour un projet de recherche : "Organizing Research Data: A Folder Structure Guide for PhD Students (Fondation allemande pour la recherche)"
La Fondation allemande pour la recherche propose un plan de classement sous forme de fiche synthétique (organisation des dossiers avec recommandations et lignes directrices). Ce template doit être retravaillé et ajusté comme pour tout autre modèle, afin de le faire correspondre à vos besoins dans le cadre de votre projet de recherche.
Décrire et communiquer ses données de recherche
Décrire ses données de recherche et rendre leur contexte de création compréhensible et explicite constituent une étape de documentation essentielle d'un projet de recherche, afin de pouvoir préserver ses données, les réutiliser ou encore les partager auprès de ses pairs. La description des données de recherche peut prendre différentes formes documentaires, parmi lesquelles les métadonnées, qui permettent de vous inscrire dans des pratiques disciplinaires communes et d'ainsi renforcer la découverte et la réutilisation de vos données de recherche par vos pairs. D'autres outils documentaires complètent les métadonnées, à l'instar des fichiers README. Par ailleurs, la mise à disposition des données de recherche est concomitante du format de fichiers, un sujet déterminant pour renforcer le potentiel de réutilisation de vos données.
Les ressources sélectionnées par l’équipe de CoDataSorb vous permettront de comprendre les modalités de description des données à votre disposition (métadonnées, standards, schémas, vocabulaires contrôlés, README) ainsi que les modalités de communication des fichiers de données (formats), qui constituent un enjeu de documentation central dans la gestion vertueuse de vos matériaux de recherche.
-
Les métadonnées, un outil de description des données de recherche essentiel
Les métadonnées désignent "un ensemble d'informations structurées qui décrit, explicite et localise une ressource informationnelle, dans le but d'en faciliter la recherche, l'usage et la gestion". Plusieurs types de métadonnées existent : les métadonnées embarquées, directement intégrées dans les fichiers de données eux-mêmes (informations techniques et contextuelles), et les métadonnées externes, ajoutées aux fichiers de données (titre, auteur, date de création, conditions d'accès, mots-clés...). Parce qu'elles sont garantes de la réutilisabilité et de la pérennité des jeux de données, les métadonnées occupent un rôle central pour la découverte, le partage et la réutilisation des données.
Citation et texte adapté issus de la définition proposée par le Collège Données de la recherche du Comité pour la science ouverte "Faciliter la documentation des données grâce aux métadonnées dans un projet de recherche"
DoRANum, "La minute Métadonnées"
En moins de 3 minutes, cette brève vidéo de l'Inist-CNRS propose une introduction aux métadonnées : définition, enjeux, standards et outils à disposition de la communauté de recherche.DoRANum, "Cours introductif sur les métadonnées"
Ce guide interactif de l'Inist-CNRS propose une introduction des principales notions et outils essentiels entourant les métadonnées : définition et enjeux, différences de types de métadonnées (enrichies et embarquées), standards et schémas de métadonnées, enrichissement par des vocabulaires contrôlés.Blog de l'Institut Pasteur, "Documenter ses données par des métadonnées tout au long de son projet : une check-list pour ne rien oublier"
L'Institut Pasteur met à disposition sur son blog un article synthétique autour de l'importance des métadonnées tout au long de son projet de recherche. Plusieurs étapes du cycle de vie des données sont ainsi passées en revue, en insistant sur le rôle des métadonnées pour chacune d'entre elles. Cet article est une synthèse du guide-checklist "Faciliter la documentation des données grâce aux métadonnées dans un projet de recherche" conçu par le collège Données de la recherche du Comité pour la science ouverte, qu'il est recommandé de consulter pour bénéficier de l'entièreté des préconisations.Urfist Méditerranée, "Les métadonnées sont partout ! Focus sur les métadonnées embarquées"
L'Urfist Méditerranée met à disposition un guide sur les métadonnées embarquées, leurs avantages et les risques qu'elles comportent. Ces données encodées dans les fichiers eux-mêmes contiennent de nombreuses informations sur les caractéristiques du document, y compris des métadonnées sensibles pour lesquelles la mise en place de mesures de sécurité est essentielle.Les standards de métadonnées
Les standards de métadonnées permettent de mobiliser les métadonnées qui sont couramment utilisées pour chaque discipline et qui sont adoptées comme modèle reconnu et normalisé par les communautés de recherche. Constitués de différents schémas, ces standards favorisent la réutilisation et l'interopérabilité des données de recherche, en conformité avec les principes FAIR.
Des répertoires de standards disciplinaires existent afin d'identifier les standards de métadonnées reconnus dans votre discipline, tels que ceux de FAIRsharing, de Digital Curation Centre (DCC) et de Research Data Alliance (RDA). Afin de faciliter ces recherches, les standards peuvent être classés par disciplines : "Social Sciences" et "Art and Humanities".DoRANum, "Les schémas de métadonnées"
En moins de 5 minutes, la vidéo de l'Urfist Méditerranée propose une introduction aux schémas de métadonnées, soit les normes structurant les différents standards de métadonnées. Ces schémas de métadonnées sont constitués par des listes d'éléments descriptifs reliés entre eux et sont définis par diverses caractéristiques structurantes.
Les vocabulaires contrôlés
Les vocabulaires contrôlés désignent des lexiques normalisés (tels que des thésaurus, listes, ontologies...) couramment utilisés par les communautés scientifiques disciplinaires. Ils permettent d'enrichir les métadonnées au moment du dépôt des données dans un entrepôt, et de renforcer ainsi leur visibilité et réutilisation.
Loterre, répertoire de vocabulaires contrôlés
Istex Loterre (Linked open terminology resources) est un répertoire de vocabulaires contrôlés classés par disciplines, dont les SHS.Outils d’aide à la saisie des métadonnées
Des outils facilitant la saisie des métadonnées sont mis à disposition pour la communauté scientifique (générateur, checklist).
DoRANum et le générateur de métadonnées "DataCite Metadata Generator"
DoRANum met à disposition un générateur de métadonnées pour les données de recherche, en suivant le schéma de DataCite, un standard utilisé pour l'attribution d'identifiants pérennes Digital Object identifier (DOI).Collège Données de la recherche du Comité pour la science ouverte et sa cheklist "Faciliter la documentation des données grâce aux métadonnées dans un projet de recherche"
Ce guide-checklist propose un ensemble de préconisations tout au long des étapes du cycle de vie des données (objectifs, acteurs concernés, actions).Pour aller plus loin sur les métadonnées
Quelques ressources complémentaires sur les métadonnées.
DoRANum, "Métadonnées, standards, formats - Comment décrire les données ?"
DoRANum met à disposition un vaste répertoire de ressources à explorer sur les métadonnées : fiche synthétique, vidéos, guide, autoévaluation pour tester ses connaissances...DARIAH et le service Vocabs autour de la création, la maintenance et l'utilisation de vocabulaires contrôlés en ALL-SHS
À destination de la communauté ALL-SHS, le service Vocabs de DARIAH (Digital Research Infrastructure for the Arts and Humanities) permet de parcourir des vocabulaires contrôlés publiés sur la plateforme (Vocabs browse) mais aussi d'en créer et d'en éditer de manière collaborative (Vocabs editor).CLARIN et son répertoire de domaines d'application des standards par sujet
L'infrastructure européenne CLARIN consacrée au partage de ressources et d'outils autour du langage met à disposition une liste de domaines d'application des standards de métadonnées.CLARIN et son répertoire de métadonnées par champ disciplinaire
CLARIN propose un répertoire de métadonnées par champ disciplinaire.DARIAH et son catalogue d'outils et de services
L'infrastructure européenne DARIAH à destination des disciplines ALL-SHS met à disposition un ensemble de services, d'outils et de ressources (volets "core services" et "community services"), notamment autour de la documentation des jeux de données. -
Décrire le contexte et l’organisation de ses données : fichiers README et autres outils documentaires
Fichiers README
En plus des métadonnées, d'autres modalités et outils documentaires sont disponibles pour mettre en œuvre la description des données de recherche, de leur contexte de production et de leur organisation, à l'instar des fichiers README (ou "Lisez-moi"). Préconisés dans les pratiques FAIR, les fichiers README sont pensés comme un complément des métadonnées et permettent dès lors de renforcer encore davantage la découverte et la réutilisation de vos jeux de données.
Recherche Data Gouv, "Modèle de README"
Recherche Data Gouv met à disposition un modèle de README, conçu pour aider à structurer la documentation de vos données de recherche.Les autres outils documentaires pour décrire l’organisation de vos données
En plus des fichiers README, d'autres documents conçus et utilisés pour gérer vos données de recherche peuvent aussi être employés et pensés comme de véritables outils de documentation : le plan de gestion de données documentant les différentes étapes de votre projet, ou encore le cahier de laboratoire (ou carnet de recherche) décrivant la méthodologie et les résultats tout au long de votre projet. Ces différents documents décrivent vos données en les contextualisant et en donnant toute information nécessaire à leur compréhension.
Texte adapté de l'article du blog de l'Institut Pasteur "Comment décrire ses données pour les rendre compréhensibles et réutilisables ?"
-
Les formats de fichiers de données
La communication des jeux de données se concrétise par l'utilisation de formats de fichiers, et particulièrement les formats ouverts comme préconisés dans les pratiques FAIR. Appliquer un format de fichier ouvert et adapté pour vos types de document est essentiel pour renforcer le partage et la réutilisation de vos données.
DoRANum, "Les formats ouverts et fermés"(PDF, 107 Ko)L'Urfist Méditerranée et l'Inist-CNRS proposent une fiche synthétique sur les formats ouverts et fermés (définitions, enjeux, alternatives aux formats fermés).
L'Urfist Méditerranée et l'Inist-CNRS mettent à disposition un tableau comparatif des formats ouverts et fermés par type de document (texte, image, tableau, vidéo, audio, présentation, archivage, dessin). La diversité des formats ouverts démontre qu'il existe de nombreuses alternatives ouvertes face aux formats propriétaires.
DoRANum, "Quiz : Format ouvert ou fermé ? Testez vos connaissances des formats de fichiers"
L'Urfist Méditerranée et l'Inist-CNRS proposent un article synthétique accompagné d'un quiz pour tester ses connaissances sur les formats de fichiers.INRAE, "Choix des formats de fichiers"
Pour aller plus loin, consulter aussi la page sur le choix des formats de fichiers de l'INRAE, relayant notamment les listes réalisées par la Library of Congress sur les formats par types de fichiers. Cette liste peut vous aider dans le choix du format adapté à votre projet de recherche.
Documenter les données textuelles
Plusieurs standards de métadonnées sont reconnus et appliqués pour les données textuelles en sciences humaines et sociales, permettant de documenter et contextualiser les données de recherche, et d'œuvrer ainsi à les rendre FAIR (Faciles à trouver, accessibles, interopérables, réutilisables). Plusieurs facteurs orientent le choix du standard : "le type de ressources décrites, le domaine scientifique dont sont issues les données, la communauté concernée par la production des données, l'entrepôt choisi pour stocker les données"*.
Les standards de métadonnées reconnus et les plus couramment utilisés en sciences sociales pour les données textuelles sont le Dublin Core (DC) et la Text Encoding Initiative (TEI), ainsi que la Data Documentation Initiative (DDI) pour les données statistiques (consulter la partie "Documenter ses données statistiques" pour plus d'informations).
Des outils et logiciels spécifiquement dédiés au traitement et à l'analyse des données textuelles peuvent être consultés dans la rubrique "Analyser ses données".
*Citation de la page "Documenter ses données" de l'Université Rennes 2
-
Documenter ses données textuelles : les ressources essentielles
Le standard de métadonnées Dublin Core (DC)
Le Dublin Core, standard de métadonnées, propose un "socle commun d'éléments descriptifs"* qui peuvent s'adapter à plusieurs types de données. Ce standard est utilisé pour décrire les données SHS, notamment lors d'un dépôt dans l'entrepôt de données Nakala. 15 propriétés de base composent le Dublin Core, auxquelles s'ajoutent 3 autres propriétés dans le cas du Dublin Core qualifié (variante enrichie).
*Citation de l'article Wikipédia
Texte adapté de la page "Documenter ses données" de l'Université Rennes 2
Site officiel du standard Dublin Core (DC)
Site officiel du standard de métadonnées Dublin Core (présentation, actualités, ressources).Inria et sa vidéo "Dublin Core pour les documents"
En quelques minutes, cette courte vidéo de l'Inria revient sur la définition du Dublin Core et ses propriétés, ainsi que sur l'analyse d'un exemple de description.Le standard de métadonnées Text Encoding Initiative (TEI)
La Text Encoding Initiative (TEI) est un "langage de description des textes en milieu numérique"*. En tant que langage de structuration de données textuelles (en XML), la TEI permet aussi de "saisir des métadonnées associées aux textes". Ce format de balisage est reconnu dans les humanités numériques, et permet d'encoder des ressources numériques, en particulier les documents textuels pour les disciplines SHS.
* Citations extraites de la page "Documenter ses données" de l'Université Rennes 2
Site officiel de la Text Encoding Initiative (TEI)
Site officiel du langage de structuration des données textuelles TEI (présentation, actualités, ressources).GRICAD, "Manuel général de TEI"
Proposé par l'Unité d'appui et de recherche GRICAD (Grenoble Alpes Recherche, Infrastructure de Calcul Intensif et de Données), ce manuel revient sur différents aspects autour de la TEI : organisation d'un projet d'édition numérique, informations sur le XML, sur la grammaire spécifique du XML et de la TEI.Projet Textométrie, "Tutoriel d’importation de corpus TEI"
Ce tutoriel proposé par le Projet Textométrie permet de créer un corpus TXM à partir d'un document XML encodé en TEI.Urfist de Bordeaux et son tutoriel "Initiation XML-TEI"
L'Urfist de Bordeaux met à disposition un tutoriel d'initiation à XML-TEI, proposant des aspects théoriques et pratiques (exercices corrigés, exemples, etc).Consortium TEI et son répertoire de ressources en autoformation sur la TEI
Pour aller plus loin sur ce sujet, le consortium TEI propose une liste de ressources pour s'autoformer sur la TEI (tutoriels généralistes, guides d'application).DARIAH et son tutoriel sur la TEI
Pour aller plus loin sur la TEI, l'infrastructure européenne DARIAH à destination des disciplines ALL-SHS met à disposition un tutoriel sur la TEI (supports en allemand).Data Documentation Initiative (DDI), le standard de métadonnées pour les données d’enquête et données statistiques
La Data Documentation Initiative (DDI) est un standard de métadonnées pour les données en sciences sociales, économiques, comportementales, et plus particulièrement adapté pour les données statistiques et les données issues d'enquêtes.
Pour plus d'informations, consulter la partie suivante "Documenter les données statistiques".
Site officiel du standard Data Documentation Initiative (DDI)
Site officiel du standard de métadonnées DDI (présentation, actualités, ressources).
Documenter les données d’enquête et les données statistiques
Essentielle pour contextualiser ces données et œuvrer à les rendre FAIR, la documentation des données statistiques et des données d'enquête comporte des singularités, parmi lesquelles les normes et standards de métadonnées reconnus et couramment utilisés : vocabulaires contrôlés, nomenclatures ou encore standard de métadonnées (Data Documentation Initiative (DDI))... adaptés pour décrire ce matériau de recherche.
Des outils et logiciels spécifiquement dédiés au traitement et à l'analyse des données statistiques et d'enquêtes (R, Python, etc) peuvent être consultés dans la rubrique "Analyser ses données".
-
Documenter ses données d‘enquête et ses données statistiques : les ressources essentielles
Quelques ressources pour comprendre les enjeux de la documentation des données statistiques : objectifs, pratiques, recommandations.
CDSP, Adisp, "Pourquoi et comment documenter ses données ?"
Ce support de présentation conçu par les Archives de données issues de la statistique publique (Adisp) et le Centre de données socio-politiques de SciencesPo (CDSP) propose une introduction aux enjeux de la documentation des données issues de la statistique publique. Sont ainsi présentés les enjeux de la documentation des données qualitatives et quantitatives, les manques couramment identifiés par type de données, ainsi que les difficultés à anticiper.Insee, "Statistiques fondées sur des données administratives : Esquisse d’un cadre général"
Proposé par l'Insee, ce document de travail détaille les enjeux de la (ré)utilisation des données issues de la statistique publique, y compris du point de vue de leur description et de leur documentation (voir notamment : "La phase d'acquisition : vers une source administrative qualifiée" (partie 4), "La phase de transformation : passer du monde administratif au monde statistique" (partie 5)).
Vocabulaires contrôlés, dictionnaires et nomenclatures
Plusieurs normes reconnues et couramment utilisées sont à votre disposition pour vous accompagner dans la description des données statistiques et des données d'enquête : vocabulaires contrôlés, dictionnaires, nomenclatures.
Progedo, "Vocabulaires contrôlés acceptés par Quetelet-Progedo"
Ce document de synthèse présente les vocabulaires contrôlés acceptés par le catalogue Quetelet-Progedo pour ses métadonnées (pour plus d'informations sur ce catalogue permettant d'accéder aux données d'enquêtes publiques, consulter la rubrique "Collecter des données").Loterre, " Vocabulaire des sciences administratives"
Différents vocabulaires contrôlés thématiques et disciplinaires peuvent être mobilisés pour renseigner les métadonnées, à l'instar de celui de Loterre pour les sciences administratives.Insee, "Nomenclatures statistiques françaises des domaines économique et social"
L'Insee met à disposition "les principales nomenclatures statistiques françaises des domaines économique et social", pouvant vous aider dans la documentation de vos données.Insee, "Dictionnaire des définitions des concepts"
L'Insee propose un dictionnaire intégrant les "définitions des concepts les plus souvent utilisés" pour la statistique publique, pouvant vous aider dans la documentation de vos données.Data Documentation Initiative (DDI), le standard de métadonnées pour les données d’enquête et les données statistiques
La Data Documentation Initiative (DDI) est un standard de métadonnées reconnu et utilisé pour les données en sciences sociales, économiques, comportementales. Ce standard est mobilisé pour les données statistiques et données issues d'enquêtes. De nombreuses structures pourvoyant des données statistiques utilisent ce standard et les vocabulaires contrôlés associés (Progedo, Insee, Cessda, etc), standard qu'il est donc important d'appréhender pour ce type de données de recherche.
Site officiel de la Data Documentation Initiative (DDI)
Site officiel du standard de métadonnées DDI pour les données issues de la statistique publique (présentation, actualités, ressources).Wikipédia, "Data Documentation Initiative"
Cet article Wikipédia présente le standard DDI, ses spécifications, son déploiement.Mate-SHS et le webinaire Tut@MATE du CDSP, "DDI, un standard de documentation des données"
Dans le cadre des Tut@MATE du réseau Mate-SHS, le Centre de données socio-politiques de SciencesPo (CDSP) met à disposition le webinaire vidéocapté d’une heure dédiée à la Data Documentation Initiative, suivi d'échanges (45 minutes). Sont ainsi abordés la présentation du standard du DDI et des normes de documentation des données d'enquête, ainsi que les logiciels pour gérer les métadonnées DDI (Nesstar, Sledgehammer, Colectica). Le support de présentation est téléchargeable sur la page.DDI, "Les vocabulaires contrôlés reconnus et utilisés dans le standard DDI"
L'Alliance DDI propose une liste de vocabulaires contrôlés reconnus et utilisés pour ce standard de métadonnées. Parmi les termes listés dans ces vocabulaires contrôlés (anglais) : Aggregation Method, Data Type, Software Package, Data Source Type, Mode of Collection, etc.
Documenter les images : description et formats
La documentation et la description des images comme matériau de recherche comportent des singularités (outils, formats). Par ailleurs, des implications spécifiques en matière de propriété intellectuelle peuvent s'appliquer plus particulièrement à ce type de données, l'accès ouvert et libre à des bases de données d'images ne signifiant pas l'absence d'encadrement dans leur traitement (par exemple Gallica est ouvert et libre mais la collecte automatisée en ligne (scrapping) est encadrée). De plus, il est essentiel d'être vigilant à l’application de mesures de protection des données, particulièrement lorsqu'il s'agit d'images impliquant des personnes vivantes.
-
Documenter ses images : les ressources essentielles sur la description et les formats
Tropy, un logiciel d’organisation et de description d’images
Plusieurs guides sur le logiciel d'organisation et de description d'images Tropy permettent de vous accompagner dans la prise en main de cet outil de documentation et d'analyse.
Humathèque Condorcet, "Utiliser le logiciel Tropy pour gérer ses images et ses photographies"
L'Humathèque Condorcet propose le support de sa formation éponyme sur le logiciel Tropy utilisé pour organiser et décrire les images et les photographies, permettant ainsi de découvrir ses fonctionnalités (dont les modèles de métadonnées).BULAC, "Guide d'utilisation de Tropy : Pour bien débuter avec Tropy"
Pour aller plus loin, la BULAC met à disposition un guide complet d'utilisation de Tropy, en s'attachant sur les nombreuses possibilités et fonctionnalités proposées par ce logiciel de gestion et description d'images.D'autres logiciels de description, d'annotation et de publication d'images sont à votre disposition pour vous accompagner dans la documentation de vos données de recherche.
Médialab de Siences Po et son logiciel Tesselle, outil d'annotation et de publication d'images
Développé par le Médialab de Sciences Po, Tesselle est un logiciel d'annotation et de publication d'images. Parmi les fonctionnalités proposées par cet outil, il est possible de charger des images en haute définition, d'ajouter des annotations textuelles à des zones spécifiques, d'exporter le résultat sous forme de site web statique.
Documenter les données linguistiques et sonores
La documentation et la description des données sonores et linguistiques comme matériau de recherche comportent des singularités (outils, formats). Par ailleurs, des implications spécifiques en matière de propriété intellectuelle et de protection des données peuvent s'appliquer plus particulièrement à ce type de matériau de recherche, la captation de la voix étant une donnée (ré)identifiante.
Les logiciels conçus pour la documentation des données linguistiques et sonores (description, annotation, édition) participent aussi activement à leur analyse. Des outils spécifiquement dédiés au traitement et à l'analyse des données sonores et linguistiques peuvent également être consultés dans la rubrique "Analyser ses données".
-
Documenter ses données linguistiques et sonores : les ressources essentielles
CLARIN, parcours d'autoformation autour de la documentation des Language Resource : "Introduction to Language Data - Metadata Standards for Language Resources"
L'infrastructure européenne CLARIN met à disposition un parcours d'autoformation autour de la documentation du langage. Différents modules sont proposés (standards et entrepôts, citer un jeu de données, conservation...), dont le module 3d "Metadata Standards for Language Resources" permettant de découvrir les standards de métadonnées pour ce type de données.OLAC et le schéma de métadonnées de référence pour les ressources linguistiques
L'Open Language Archives Community (OLAC) propose un schéma de métadonnées basé sur le Dublin Core enrichi pour les ressources linguistiques (domaine linguistique, type linguistique, type de discours, code de langue). Pour plus d'informations sur OLAC, consulter aussi le module "Introduction to Language Data - Metadata Standards for Language Resources" de CLARIN présenté précédemment.Logiciels de description et d’annotation
Des logiciels de description et d'annotation des données linguistiques sont à votre disposition pour vous accompagner dans la documentation de vos données de recherche. Les logiciels SayMore et Lameta présentés ici ont notamment été recensés par le laboratoire Lacito (UMR CNRS, Sorbonne Nouvelle, Inalco).
SayMore, le logiciel de documentation linguistique
SayMore est un logiciel de documentation linguistique conçu pour aider à la collecte des données sonores, la conversion des fichiers et l'organisation des métadonnées. Parmi les fonctionnalités proposées, il est possible d'enregistrer des entretiens, d'organiser les métadonnées, de convertir les fichiers vers des formats d'archivage, d'exporter vers ELAN ou YouTube, d'annoter et de convertir les données au format IMDI*.*Exemples issus de la présentation "Metadata Standards for Language Resources" de CLARIN, traduits en français.
Lameta, le logiciel d’organisation des métadonnées et jeux de données
Issu du logiciel SayMore, Lameta est un outil permettant d'organiser les métadonnées des jeux de données linguistiques.Lexiques et terminologies
Zoom sur des répertoires de lexiques et de terminologies pour les données linguistiques.
Ortolang et son répertoire de lexiques
La plateforme d'outils et de ressources linguistiques Ortolang propose un répertoire de lexiques.Ortolang et son répertoire de terminologies
La plateforme d'outils et de ressources linguistiques Ortolang propose un répertoire de terminologies normalisées susceptibles d'être utiles pour ces données.SpeaK, plateforme d'organisation, de présentation et de partage de lexiques sonores
La plateforme SpeaK développée par l'Ircam permet de créer et de partager des lexiques sonores. Elle a été initiée pour "améliorer [les] connaissances sur les sons [et les] aptitudes à parler des sons".
Citation issue de la page de présentation des logiciels de l’IrcamLogiciels de conversion de standards de métadonnées
Plusieurs outils de conversion et d'édition de la TEI et d'autres formats sont proposés pour vous accompagner dans la description de vos données de recherche.
L'outil Teinte, un convertisseur automatique de documents sous différents formats
Développé par l'Observatoire des textes, des idées et des corpus (ObTIC) de Sorbonne Université, Teinte est un outil de conversion automatique de documents, permettant de traiter différents formats (TEI, DOCX, HTML, EPUB, MARKDOWN).L'outil TEICONVERT, un convertisseur de métadonnées
Proposé par la plateforme Ortolang, TEICONVERT est un outil de conversion de Elan, Clan, Transcriber et Praat vers la TEI (et inversement).L'outil TEIMETA, un éditeur de métadonnées
Proposé par la plateforme Ortolang, TEIMETA est un outil d'édition des fichiers XML à partir d'une description.Pour aller plus loin
Les outils présentés ici sont principalement conçus pour la documentation des données (description, annotation, édition), bien qu'ils participent simultanément à leur analyse. Des logiciels spécifiquement dédiés au traitement et à l'analyse des données sonores et linguistiques peuvent être utilisés dans vos projets de recherche : pour plus d'informations, consulter la rubrique "Analyser ses données".
Contacts
L’Atelier de la donnée CoDataSorb
Une seule adresse mail générique à retenir pour contacter CoDataSorb, l'Atelier de la donnée de Sorbonne Alliance : codatasorb@sorbonne-alliance.fr
Les Plateformes universitaires de données (PUD)
Les Plateformes universitaires de données (PUD) peuvent vous accompagner dans la documentation des données quantitatives ("données issues de la statistique publique, grandes enquêtes nationales et internationales notamment"), et plus généralement sur leur utilisation et sur les "méthodes d’analyse quantitatives, afin de contextualiser, d’enrichir et de conduire leurs analyses de recherche"*.
*MSH Mondes, "Plateforme universitaire de données"
- La PUDN (Université Paris Nanterre, Université Paris 1 Panthéon Sorbonne)
- Les PUD à Paris :
- CDSP de SciencesPo
- PUD des Grands Moulins (Paris Cité)