La gestion de vastes dépôts de données psychologiques représente l'un des défis les plus critiques auxquels sont confrontés les établissements de recherche modernes, les organismes de santé et les centres universitaires.À mesure que le volume de données de recherche psychologique continue de croître de façon exponentielle, la nécessité de stratégies de gestion des données sophistiquées, sûres et efficaces n'a jamais été aussi pressante.
Comprendre la portée et la complexité des dépôts de données psychologiques
Les répertoires de données psychologiques englobent une vaste gamme de types d'information, allant des évaluations cliniques et des données de neuroimagerie aux observations comportementales, aux réponses aux enquêtes et aux dossiers d'études longitudinales. La complexité de la gestion et du partage des données en psychologie est démontrée par les multiples formes de données recueillies auprès des participants humains, analysées à l'aide d'une gamme d'outils logiciels et archivées dans des formats qui peuvent devenir obsolètes.
La recherche psychologique moderne génère des données à des échelles sans précédent, avec des études individuelles pouvant produire des téraoctets d'information.Ces données sont présentées en plusieurs formats, y compris des bases de données structurées, des enregistrements vidéo, des fichiers audio, des analyses de neuroimagerie, des informations génétiques et des textes non structurés à partir de notes cliniques ou de transcriptions d'entrevues.
Contrairement à de nombreuses autres disciplines scientifiques, la recherche psychologique implique souvent des renseignements profondément personnels sur la santé mentale des participants, leur fonctionnement cognitif, leurs comportements et leurs états émotionnels. Cette sensibilité nécessite des mesures de sécurité rigoureuses et des considérations éthiques qui vont au-delà des pratiques de gestion des données standard.
Établissement de cadres de gouvernance des données globales
Un cadre solide de gouvernance des données sert de fondement à toutes les activités de gestion des données au sein des dépôts de recherche psychologique. Ce cadre doit définir clairement les rôles, les responsabilités, les politiques et les procédures qui guident la collecte, le stockage, l'accès, le partage et, en bout de ligne, la retraite ou l'archivage des données.
Définition de la propriété et de l'intendance des données
Les politiques de gouvernance des données devraient préciser qui possède les données à divers stades du cycle de vie de la recherche, de la collecte initiale à la publication et à l'archivage à long terme. En règle générale, les établissements conservent la propriété ultime des données de recherche, tandis que les chercheurs principaux servent de responsables de la gestion des données au quotidien.
Les rôles de gérance des données devraient être documentés officiellement, les personnes chargées de la qualité des données, de la sécurité, du contrôle de l'accès et de la surveillance de la conformité étant le principal point de contact pour les questions relatives aux données et servant de liaison entre les chercheurs, les services de TI, les comités d'examen institutionnels et les intervenants externes.
Mise en oeuvre des hiérarchies de contrôle d'accès
Les politiques de contrôle de l'accès doivent concilier la nécessité de la sécurité des données et l'impératif de faciliter les activités de recherche légitimes.
- Accès complet: Réservé aux chercheurs principaux et aux gestionnaires de données désignés qui ont besoin d'un contrôle complet sur les ensembles de données
- Accès analytique:[ Accordé aux membres de l'équipe de recherche qui doivent analyser les données mais qui ne modifient pas les documents originaux
- Accès limité:[ Fourni aux collaborateurs ou aux étudiants qui ont besoin d'accéder à des sous-ensembles spécifiques de données
- Accès aux métadonnées uniquement:[ Disponible aux chercheurs qui cherchent à découvrir quelles données existent sans avoir accès aux enregistrements réels
- Accès public:[ Pour les ensembles de données dé-identifiés approuvés pour le partage ouvert
Chaque niveau d'accès devrait être accompagné d'ententes d'utilisation claires qui précisent les activités autorisées, les utilisations interdites et les conséquences pour les infractions aux politiques.
Élaboration d'ententes et de politiques sur l'utilisation des données
Les ententes d'utilisation globale des données (AED) sont essentielles pour régir la façon dont les données peuvent être utilisées, tant au sein de l'établissement d'origine qu'à l'occasion de leur communication à des chercheurs externes, qui devraient porter sur les exigences en matière de sécurité des données, les analyses autorisées, les droits de publication, les attentes en matière de reconnaissance et les restrictions à la redistribution des données.
Les politiques devraient également porter sur les calendriers de conservation des données, en précisant la durée pendant laquelle les différents types de données doivent être conservés pour se conformer aux exigences réglementaires, aux politiques institutionnelles et aux mandats des organismes de financement.
Navigation des normes de conformité et d'éthique réglementaires
Les dépôts de données psychologiques doivent se conformer à un ensemble complexe d'exigences réglementaires et d'obligations éthiques conçues pour protéger les participants à la recherche et assurer un traitement responsable des données.
Conformité de l'HIPAA aux données psychologiques liées à la santé
HIPAA protège les renseignements sur la santé protégés (PHI) aux États-Unis et de nombreux dépôts de recherche psychologique contiennent des données qui relèvent de la compétence de HIPAA. HIPAA s'applique aux « entités couvertes » et à leurs associés commerciaux aux États-Unis qui traitent des renseignements sur la santé protégés (PHI), notamment les fournisseurs de soins de santé qui effectuent des recherches psychologiques, des plans de santé et des centres de communication pour les soins de santé.
Les mesures de protection administratives comprennent l'élaboration de politiques de sécurité, la formation des employés et l'établissement de procédures pour réagir aux incidents de sécurité. Les mesures de protection physique comprennent le contrôle de l'accès physique aux installations et aux postes de travail où l'on stocke ou accède à l'ISP. Les mesures de protection techniques comprennent le cryptage, les contrôles d'accès, l'enregistrement des vérifications et les protocoles de transmission de données sécurisés.
L'HIPAA exige que les entités visées avisent les personnes touchées et le ministère de la Santé et des Services humains des États-Unis dans les 60 jours suivant la découverte d'une violation impliquant des renseignements protégés sur la santé, tandis que le RGPD exige que les responsables du traitement des données signalent les violations de données personnelles à l'autorité de surveillance compétente dans les 72 heures.
Exigences du RGPD pour la recherche internationale
Pour la recherche psychologique impliquant des participants de l'Union européenne ou de l'Espace économique européen, le règlement général sur la protection des données est devenu loi le 25 mai 2018 et s'applique à toutes les organisations ciblant ou recueillant des informations personnelles identifiables (PII) de personnes au Royaume-Uni ou dans l'UE, qu'elles opèrent physiquement ou non dans ces juridictions.
Le RGPD impose des exigences strictes en matière de traitement des données, notamment en obtenant un consentement explicite, en mettant en œuvre des principes de minimisation des données, en assurant la portabilité des données et en respectant les droits des personnes à accéder, à corriger ou à supprimer leurs informations personnelles.
Une organisation qui traite des informations de santé protégées en vertu de l'HIPAA et traite également les données personnelles des personnes de l'UE peut devoir se conformer aux deux règlements, les fournisseurs de soins de santé, les assureurs ou les entreprises de technologie desservant les résidents de l'UE devant se recouper, en exigeant que les organisations cartographient les cas où les exigences se croisent et appliquent la norme plus stricte pour réduire les risques de conformité.
Surveillance du Conseil d'examen institutionnel
Outre la conformité à la réglementation, les dépôts de données psychologiques doivent respecter les normes éthiques établies par les commissions d'examen institutionnel (CCRI) ou les comités d'éthique. Ces organismes examinent les protocoles de recherche pour assurer la protection des participants, les procédures de consentement éclairé et les pratiques de traitement des données appropriées.
Les gestionnaires des dépôts devraient maintenir des relations étroites avec leurs RIR pour assurer la conformité continue et pour obtenir des conseils lorsque des questions se posent au sujet du partage des données, de l'utilisation secondaire ou de la conservation à long terme.
Mise en œuvre de mesures de sécurité des données robustes
La sécurité est primordiale pour gérer les données psychologiques sensibles. Une approche de sécurité multicouches offre la meilleure protection contre les violations de données, l'accès non autorisé et d'autres menaces de sécurité.
Stratégies de chiffrement
Le chiffrement est une exigence fondamentale en vertu du RGPD et de l'HIPAA pour la protection des données sensibles, avec ces règlements qui exigent le chiffrement des données personnelles et des données personnelles tant au repos qu'en transit, impliquant la sécurisation des données stockées à l'aide d'algorithmes de chiffrement rendant les données illisibles sans clés de chiffrement appropriées.
Les données au repos devraient être chiffrées à l'aide d'algorithmes standards de l'industrie tels que AES-256. Ceci s'applique aux données stockées sur les serveurs, les supports de sauvegarde, les appareils portables et les plateformes de stockage en nuage.
Les données en transit nécessitent un cryptage par des protocoles sécurisés tels que TLS/SSL pour l'accès en ligne, SFTP pour les transferts de fichiers et les connexions VPN pour l'accès à distance aux systèmes de dépôt.
Authentification et contrôle d'accès
Des mécanismes d'authentification solides sont essentiels pour vérifier l'identité des utilisateurs avant de leur accorder l'accès aux dépôts de données psychologiques. L'authentification multi-facteurs (AMF) devrait être requise pour tous les utilisateurs, combinant quelque chose qu'ils connaissent (mot de passe), quelque chose qu'ils possèdent (jeton de sécurité ou appareil mobile) et potentiellement quelque chose qu'ils sont (vérification biométrique).
Les politiques relatives aux mots de passe devraient imposer des exigences de complexité, modifier régulièrement les mots de passe et interdire la réutilisation des mots de passe.
Les systèmes de contrôle d'accès fondés sur les rôles (RBC) garantissent aux utilisateurs que seuls les données et les fonctions appropriées à leur rôle sont accessibles. Les autorisations d'accès doivent respecter le principe du moins de privilèges, ce qui leur permet d'accéder au minimum nécessaire à l'exercice de leurs fonctions légitimes.
Sécurité du réseau et détection d'intrusion
Les systèmes de dépôt devraient être protégés par des pare-feu, des systèmes de détection d'intrusion (SDI) et des systèmes de prévention des intrusions (SIP) qui surveillent le trafic de réseau pour détecter toute activité suspecte.
Les tests de détection et de pénétration de vulnérabilités permettent de déceler les faiblesses de sécurité avant qu'elles ne puissent être exploitées par des acteurs malveillants.
Vérification du processus d'exploitation et de surveillance
Le RGPD et l'HIPAA prévoient des contrôles d'accès rigoureux pour protéger les données sensibles, en exigeant que les organisations mettent en œuvre des mesures pour s'assurer que le personnel autorisé peut accéder aux données personnelles ou à l'ISP, ce qui implique généralement des processus d'authentification des utilisateurs robustes, des contrôles d'accès fondés sur le rôle et des audits de routine pour surveiller et enregistrer les modèles d'accès.
Les registres d'audit complets devraient consigner tous les accès aux données psychologiques, y compris l'identité des utilisateurs, l'horodatage, les données auxquelles on a accès et les mesures prises, et ces registres doivent être protégés contre toute manipulation et être conservés pendant les périodes spécifiées par les exigences réglementaires et les politiques institutionnelles.
Les systèmes automatisés de surveillance peuvent analyser les journaux de vérification en temps réel pour détecter les modèles d'accès anormales, comme les temps d'accès inhabituels, les téléchargements de données en vrac ou l'accès aux données en dehors du cadre normal de travail de l'utilisateur.
Sélection et mise en œuvre de solutions de stockage efficaces
Le choix de l'infrastructure de stockage a des répercussions importantes sur la performance du dépôt, l'évolutivité, les coûts et la sécurité.
Plateformes de stockage basées sur le cloud
Le stockage en nuage offre de nombreux avantages pour les dépôts de données psychologiques, y compris l'évolutivité, la redondance géographique et la réduction du fardeau de gestion de l'infrastructure.
Lors de la sélection du stockage en nuage, il faut tenir compte de facteurs tels que les exigences de souveraineté des données, qui peuvent restreindre les possibilités de stockage physique des données, en particulier pour la recherche internationale soumise au RGPD.
Les niveaux de stockage en nuage permettent d'optimiser les coûts en stockant des données fréquemment accessibles sur le stockage à haute performance tout en archiveant des données plus anciennes ou moins accessibles sur des niveaux de stockage à moindre coût.
Infrastructure de stockage sur site
Certaines institutions préfèrent le stockage sur site pour un contrôle maximal de la sécurité des données et pour répondre aux préoccupations concernant la souveraineté des données en nuage.Les solutions sur site nécessitent des investissements importants dans le matériel, les installations et le personnel informatique, mais assurent un contrôle complet de l'environnement de stockage.
Les systèmes de stockage sur site modernes utilisent des technologies telles que les réseaux de stockage (SAN), le stockage connecté au réseau (NAS) et les plates-formes de stockage d'objets, qui devraient comprendre des redondances par l'intermédiaire de configurations RAID, des capacités de décrochage automatisées et des sauvegardes régulières vers des systèmes ou des emplacements distincts.
Approches de stockage hybride
De nombreuses organisations adoptent des stratégies de stockage hybride combinant sur site et stockage en nuage. Les données de recherche actives peuvent être stockées sur site pour des performances et des contrôles, tandis que les études terminées sont archivées dans le stockage en nuage pour une conservation à long terme.
Les approches hybrides exigent une planification minutieuse afin d'assurer un mouvement de données sans heurt entre les niveaux de stockage, des politiques de sécurité cohérentes entre les environnements et des contrôles d'accès unifiés qui fonctionnent indépendamment de l'endroit où les données sont stockées physiquement.
Organisation des données avec des formats et métadonnées normalisés
Une organisation efficace des données est essentielle pour permettre la découverte, faciliter la réutilisation et assurer l'accessibilité à long terme des données de recherche psychologique.
Adopter les principes de FAIR Data
Les meilleures pratiques en matière de partage de données comprennent les principes FAIR (Findable, Accessible, Interoperable, Reusable), qui constituent un cadre pour l'organisation et le partage des données de recherche de manière à maximiser leur valeur pour la communauté scientifique.
Retrouvable :[ Les données doivent être faciles à découvrir au moyen de métadonnées complètes, d'identificateurs persistants uniques (tels que les DOI) et d'enregistrement dans des dépôts consultables. Les métadonnées doivent décrire le contenu, le contexte, la qualité et les conditions d'accès des données.
Accessible:[ Une fois les données découvertes, elles doivent être récupérées au moyen de protocoles normalisés, ce qui ne signifie pas nécessairement que l'accès libre — certaines données peuvent avoir des restrictions d'accès légitimes — mais le processus d'accès doit être clair et bien documenté.
Interopérables: Les données doivent utiliser des formats et des vocabulaires normalisés qui permettent l'intégration avec d'autres ensembles de données et la compatibilité avec des outils d'analyse communs, ce qui facilite les méta-analyses et les comparaisons entre études.
Reutilisable: Les données doivent être suffisamment documentées et autorisées pour permettre la réutilisation par d'autres chercheurs, notamment des renseignements clairs sur la provenance, des descriptions méthodologiques détaillées et des licences d'utilisation appropriées.
Mise en œuvre des normes relatives aux métadonnées
Les métadonnées complètes sont essentielles pour rendre les données psychologiques accessibles et compréhensibles. Les métadonnées doivent décrire l'ensemble des données et les variables ou éléments de données individuels dans l'ensemble des données.
Les métadonnées au niveau des ensembles de données devraient comprendre des renseignements tels que le titre de l'étude, le chercheur principal, les sources de financement, les dates de collecte des données, les données démographiques des participants, les méthodes d'échantillonnage et les détails d'approbation éthique.
Envisager d'adopter des normes spécifiques à la discipline, telles que celles élaborées par l'Initiative de documentation des données (IDD) pour les sciences sociales et comportementales, ou des normes spécifiques à un domaine pour des types de données spécialisés comme le neuroimagerie (BIDS - Brain Imaging Data Structure) ou des données génétiques.
Conventions de désignation de dossiers et d'organisation
Les conventions de nommage de fichiers et les structures de répertoires uniformes facilitent la navigation des données et réduisent le risque d'erreurs. Les noms de fichiers doivent être descriptifs, inclure les dates ou numéros de version pertinents et éviter les caractères spéciaux qui peuvent causer des problèmes dans différents systèmes d'exploitation.
Les structures de répertoires doivent être logiques et hiérarchiques, généralement organisées par étude, participant, session et type de données. Les fichiers de documentation, y compris les fichiers README, les codes et les dictionnaires de données, doivent être placés aux niveaux appropriés de la hiérarchie de répertoires pour fournir le contexte des données qu'ils décrivent.
Contrôle de version et provenance des données
Le maintien du contrôle de version des ensembles de données permet de suivre les changements et de récupérer les versions antérieures si nécessaire. Les systèmes de contrôle de version devraient documenter ce qui a changé, quand, pourquoi et par qui. Ceci est particulièrement important pour les ensembles de données qui subissent le nettoyage, la transformation ou l'analyse.
Le suivi de la provenance des données documente l'historique complet d'un ensemble de données de la collecte initiale à toutes les étapes de traitement, y compris les informations sur les sources de données, les scripts de traitement, les versions logicielles et les paramètres d'analyse.
Assurer la qualité et la cohérence des données
La gestion de la qualité des données devrait être intégrée tout au long du cycle de vie de la recherche, de la collecte initiale à l'archivage à long terme.
Mise en œuvre des procédures de validation des données
La validation des données devrait commencer au point de collecte, avec des systèmes de saisie électronique des données mettant en œuvre des règles de validation en temps réel qui vérifient les valeurs hors gamme, les incohérences logiques et les champs manquants requis.
La validation après la collecte devrait comprendre des vérifications systématiques de l'exhaustivité, de l'exactitude, de la cohérence et de la plausibilité des données. Les méthodes statistiques peuvent identifier des valeurs aberrantes et anormales qui peuvent indiquer des erreurs de saisie des données ou des problèmes de mesure.
Nettoyage et normalisation des données
Les processus de nettoyage des données portent sur des questions telles que les enregistrements en double, le codage incohérent, les variations de formatage et les données manquantes. Les procédures de nettoyage doivent être documentées en détail, les données brutes originales étant conservées aux côtés des versions nettoyées.
La normalisation assure la cohérence entre les ensembles de données, particulièrement lorsqu'il s'agit de combiner des données provenant de plusieurs études ou sources, notamment la normalisation des noms de variables, des schémas de codage, des unités de mesure et des formats de date.
Assurance de la qualité et contrôle de la qualité
L'assurance de la qualité (AQ) englobe les processus et procédures systématiques conçus pour prévenir les problèmes de qualité, tandis que le contrôle de la qualité (QC) consiste à détecter et à corriger les problèmes de qualité qui se posent.
Les activités d'AQ comprennent l'élaboration de procédures opérationnelles normalisées, la formation des collecteurs de données, l'étalonnage des instruments de mesure et la mise en oeuvre de protocoles de collecte de données qui réduisent au minimum les erreurs.
Les vérifications de la qualité régulières devraient évaluer la conformité aux procédures de gestion des données, cerner les problèmes systématiques de qualité et évaluer l'efficacité des processus de gestion de la qualité.
Faciliter l'accessibilité des données et le partage responsable
La communication de données psychologiques aux chercheurs qualifiés maximise sa valeur scientifique tout en respectant les obligations de confidentialité et d'éthique des participants.
Sélection de dépôts de données appropriés
Les chercheurs en psychologie devraient utiliser un dépôt de données approuvé pour stocker leurs données, qui garantit la longévité et la qualité des archives. Plusieurs dépôts spécialisés servent la communauté de recherche psychologique, chacun avec des caractéristiques, des politiques et des publics cibles différents.
Un nombre important de participants (42,31 %) ont déclaré avoir déposé un code ou une syntaxe de collecte de données dans le cadre scientifique ouvert afin de le partager avec d'autres. Le cadre scientifique ouvert (CSF) offre une plateforme libre et ouverte pour la gestion des projets de recherche et le partage de données, avec des fonctionnalités de collaboration, de contrôle des versions et d'intégration avec d'autres outils de recherche.
L'ICPSR (Consortium interuniversitaire pour la recherche politique et sociale) gère des archives de données de plus de 500 000 dossiers de recherche en sciences sociales. L'ICPSR offre de nombreux services de curation, de préservation à long terme et une infrastructure de dépôt fiable qui a servi la communauté des sciences sociales pendant des décennies.
Des dépôts de données spécifiques comme Databrary, une bibliothèque de données permettant aux chercheurs de partager des données de recherche et des outils d'analyse avec d'autres chercheurs, sont des dépôts Web pour le partage et la préservation ouverts des données vidéo et des métadonnées connexes dans le domaine des sciences du développement.
Techniques de dé-identification et d'anonymisation
La protection de la vie privée des participants est primordiale lorsqu'il s'agit de partager des données psychologiques. La désidentification supprime ou obscurcit les renseignements personnels identifiables, tandis que l'anonymat va plus loin pour rendre la réidentification pratiquement impossible.
Les identifiants directs tels que les noms, adresses, numéros de téléphone et numéros de sécurité sociale devraient être retirés des ensembles de données partagés. Il peut être nécessaire de généraliser ou de supprimer les identifiants indirects comme les dates de naissance, les emplacements géographiques et les caractéristiques rares pour empêcher la réidentification par la combinaison avec d'autres sources de données.
Les techniques avancées telles que la perturbation des données, l'agrégation et la production de données synthétiques peuvent fournir une protection supplémentaire de la vie privée tout en préservant l'utilité des données à des fins de recherche.
Mise en œuvre de modèles d'accès à niveau
Les modèles d'accès à niveau établissent un équilibre entre le partage des données et la protection de la vie privée en offrant différents niveaux d'accès en fonction de la sensibilité des données et des qualifications des utilisateurs. Les niveaux d'accès ouvert offrent un accès illimité aux données entièrement dé-identifiées avec un risque minimal de réidentification.
Certains dépôts mettent en place des modèles d'accès à distance où les chercheurs peuvent analyser des données sans les télécharger, ce qui permet une couche supplémentaire de sécurité pour les ensembles de données très sensibles.
Élaboration d'ententes claires sur l'utilisation des données
Les accords d'utilisation des données (ADU) établissent les modalités et les conditions d'accès et d'utilisation des données, qui doivent préciser les utilisations autorisées, les activités interdites, les exigences en matière de sécurité, les attentes en matière de publication et les conséquences pour les violations.
Les AUC devraient répondre aux exigences en matière de citation des données, en veillant à ce que les créateurs de données reçoivent le crédit approprié pour leur travail.
Les accords devraient clarifier les droits de propriété intellectuelle, en précisant si les utilisateurs peuvent créer des oeuvres dérivées, si les données peuvent être redistribuées et comment l'utilisation commerciale est traitée.
Formation et soutien complets
Même la meilleure infrastructure de gestion des données est inefficace sans un personnel bien informé qui comprend comment l'utiliser correctement. Des programmes de formation complets sont essentiels pour maintenir des normes élevées dans le traitement des données.
Élaboration de programmes de formation spécifiques aux rôles
Les chercheurs principaux doivent comprendre les politiques de gouvernance, les exigences réglementaires et leurs responsabilités en tant que responsables de l'administration des données. Le personnel de recherche doit recevoir une formation détaillée sur les procédures de collecte des données, le contrôle de la qualité et les protocoles de sécurité.
La formation devrait porter à la fois sur les compétences techniques et sur la compréhension conceptuelle, et non seulement sur la façon de suivre les procédures, mais aussi sur les raisons pour lesquelles ces procédures sont importantes pour protéger les participants, assurer la qualité des données et maintenir la conformité aux règlements.
Mise en œuvre de l'éducation permanente
Les pratiques exemplaires, les technologies et les règlements en matière de gestion des données évoluent continuellement, ce qui nécessite une formation continue plutôt qu'une formation ponctuelle.
Envisager de mettre en place un système de gestion de l'apprentissage (SGL) qui assure le suivi de la formation, fournit des modules d'apprentissage en ligne et envoie des rappels pour les renouvellements de formation requis, ce qui garantit que tous les employés conservent leurs connaissances actuelles et fournissent des documents de formation aux fins de conformité.
Création de documentation et de ressources
La documentation complète appuie les efforts de formation et fournit des documents de référence permanents au personnel, notamment des procédures opérationnelles normalisées (PON) pour toutes les activités de gestion des données, des guides de référence rapides pour les tâches communes, des ressources de dépannage et des coordonnées pour l'appui.
La documentation devrait être facilement accessible, consultable et régulièrement mise à jour pour refléter les procédures actuelles. Envisager de créer une base de connaissances centralisée ou wiki où le personnel peut trouver des réponses à des questions communes et partager les meilleures pratiques.
Établissement de structures de soutien
Les services de soutien devraient être facilement accessibles par de multiples canaux, tels que les systèmes de messagerie, de téléphone ou de billetterie en ligne. Les attentes en matière de temps de réponse devraient être clairement communiquées, les questions cruciales devant recevoir une attention prioritaire.
Envisager de créer une communauté de pratique où les gestionnaires de données de différents groupes de recherche peuvent partager leurs expériences, discuter des défis et élaborer des solutions en collaboration.
Mise en œuvre de plans de secours et de reprise après sinistre
La perte de données peut résulter de défaillances matérielles, d'erreurs logicielles, d'erreurs humaines, de catastrophes naturelles ou d'attaques malveillantes.
Élaborer des stratégies de sauvegarde
Les stratégies de sauvegarde efficaces suivent la règle 3-2-1 : conserver au moins trois copies de données, sur deux types différents de médias, avec une copie stockée hors site. Cette approche protège contre divers scénarios de défaillance, y compris les défaillances matérielles, les catastrophes sur site et les attaques ransomware.
La fréquence de sauvegarde devrait être basée sur la valeur des données et le taux de changement. Les données de recherche actives peuvent nécessiter une sauvegarde quotidienne ou même continue, tandis que les données archivées peuvent être sauvegardées moins fréquemment.
La vérification de sauvegarde est cruciale : les sauvegardes ne sont utiles que si elles peuvent être restaurées avec succès. Les restaurations d'essai régulières doivent être effectuées pour vérifier l'intégrité de la sauvegarde et assurer le fonctionnement des procédures de récupération comme prévu.
Création de plans de reprise après sinistre
Les plans de reprise après sinistre documentent les procédures de restauration des opérations après une perturbation majeure, qui devraient identifier les systèmes et les données critiques, préciser les objectifs de temps de récupération (à quelle vitesse les systèmes doivent être rétablis) et les objectifs de points de récupération (à quel point la perte de données est acceptable).
Les plans devraient porter sur divers scénarios de catastrophe, notamment les catastrophes naturelles, les cyberattaques, les défaillances du matériel et les erreurs humaines, et chaque scénario devrait comporter des procédures d'intervention documentées, des responsabilités assignées et des protocoles de communication.
Les plans de reprise après sinistre doivent être testés régulièrement au moyen d'exercices de table ou d'exercices de récupération réels. Les tests permettent de déceler les lacunes dans les procédures, de révéler les ressources manquantes et de s'assurer que le personnel connaît son rôle en cas d'urgence.
Mise en oeuvre des mesures de continuité des activités
La planification de la continuité des activités va au-delà de la récupération des données pour s'assurer que les activités de recherche peuvent se poursuivre pendant les perturbations, notamment en identifiant d'autres lieux de travail, en établissant des capacités d'accès à distance et en maintenant des systèmes redondants pour des fonctions critiques.
Les systèmes basés sur le cloud offrent souvent des redondances intégrées et une répartition géographique qui améliore la continuité des activités. Cependant, les organisations devraient comprendre les capacités de leur fournisseur de cloud en cas de sinistre et s'assurer qu'ils répondent aux exigences institutionnelles.
La technologie de levier pour une gestion améliorée des données
Les technologies modernes offrent de puissantes capacités pour gérer les dépôts de données psychologiques à grande échelle de façon plus efficace et plus efficiente.
Plateformes et systèmes de gestion de données
Les plateformes de gestion intégrée des données fournissent des outils centralisés pour le stockage, l'organisation, le contrôle d'accès et le partage des données, qui comprennent généralement des fonctions telles que la gestion des métadonnées, le contrôle des versions, l'automatisation des flux de travail et l'intégration avec les outils d'analyse.
Les systèmes de gestion des données de recherche devraient soutenir le cycle de vie complet des données de la collecte à l'archivage. Recherchez des plateformes qui s'intègrent avec des outils communs de collecte de données, fournissent des schémas de métadonnées flexibles, prennent en charge plusieurs formats de données et offrent des fonctionnalités de sécurité robustes.
Outils d'automatisation et de flux de travail
L'automatisation réduit l'effort manuel, minimise les erreurs et assure la cohérence des processus de gestion des données. Les workflows automatisés peuvent gérer des tâches telles que la validation des données, la conversion de format, l'extraction des métadonnées, l'horaire de sauvegarde et le traitement des demandes d'accès.
Les outils de gestion du flux de travail aident à orchestrer des pipelines complexes de traitement des données, à suivre les données par plusieurs étapes de traitement et à s'assurer que toutes les procédures requises sont remplies.
Intelligence artificielle et apprentissage automatique
Les technologies d'IA et d'apprentissage automatique offrent de nouvelles capacités de gestion des dépôts de données psychologiques. Le traitement en langage naturel peut automatiquement extraire des métadonnées des documents de recherche, classer les types de données et identifier les informations sensibles nécessitant une protection.
Les algorithmes d'apprentissage automatique peuvent détecter des problèmes de qualité des données, identifier les modèles d'accès anormales qui peuvent indiquer des menaces pour la sécurité et recommander des ensembles de données pertinents aux chercheurs en fonction de leurs intérêts et de leurs travaux antérieurs.
Normes d'interopérabilité et API
Les interfaces de programmation d'applications (API) permettent à différents systèmes de communiquer et de partager automatiquement les données. Les systèmes de dépôt devraient fournir des API qui permettent l'intégration avec les outils de collecte de données, les plateformes d'analyse et d'autres infrastructures de recherche.
L'adoption de normes d'interopérabilité telles que les API REST, les formats de données standard et les schémas de métadonnées communs facilite l'intégration et réduit les efforts nécessaires pour connecter différents systèmes.
Prise en compte de considérations particulières pour différents types de données
Différents types de données psychologiques présentent des défis uniques en matière de gestion qui nécessitent des approches spécialisées.
Données neuro-imagerie
Les données neuro-imagerie provenant de l'IRM, de l'IRMf, du TEP et d'autres modalités d'imagerie cérébrale génèrent de grandes tailles de fichiers et nécessitent des formats spécialisés et des pipelines de traitement.
Envisager de mettre en place un stockage à plusieurs niveaux avec des données d'imagerie brutes sur le stockage à haute capacité et les résultats traités sur un stockage plus rapide pour l'analyse.
Données vidéo et audio
Les enregistrements vidéo et audio des sessions de recherche contiennent de riches données comportementales, mais présentent d'importants défis en matière de confidentialité. Les visages et les voix sont personnellement identifiables, ce qui rend difficile la dé-identification.
Les fichiers vidéo et audio nécessitent des outils de stockage et de lecture spécialisés importants. Envisager de mettre en place des capacités de streaming plutôt que de demander des téléchargements complets, et fournir des outils de codage et d'annotation qui s'intègrent au dépôt.
Données génétiques et biologiques
Les données génétiques présentent des préoccupations particulières en matière de protection de la vie privée, car elles peuvent identifier des personnes et leurs proches.Des protections spéciales sont nécessaires, y compris un accès contrôlé, un cryptage et des procédures de consentement potentiellement additionnelles.
Les spécimens biologiques doivent être entreposés physiquement, avec des contrôles environnementaux appropriés et un suivi de la chaîne de garde.
Données qualitatives
Les données qualitatives telles que les transcriptions d'entrevues, les notes de terrain et les réponses ouvertes aux enquêtes contiennent de riches renseignements contextuels, mais peuvent être difficiles à délimiter en raison de récits personnels détaillés.
L'analyse qualitative des données implique souvent des processus itératifs de codage et d'interprétation qui devraient être documentés pour appuyer la transparence et la reproductibilité.
Planification de la préservation à long terme
Pour que les données psychologiques restent accessibles et utilisables pendant des décennies, il faut planifier soigneusement la conservation à long terme.
Format Migration et obsolescence
Les formats de fichiers deviennent obsolètes à mesure que les logiciels évoluent, rendant potentiellement les données inaccessibles. Les stratégies de conservation à long terme devraient inclure une évaluation régulière des formats, la migration vers les formats actuels au besoin et la préférence pour des formats ouverts et bien documentés plutôt que des formats propriétaires.
Maintenir des registres de format documentant les formats utilisés dans le dépôt, les logiciels qui peuvent les lire et les migrations nécessaires. Planifier soigneusement les migrations de format, en validant que l'intégrité des données est maintenue par le processus de conversion.
Identificateurs persistants
Les lignes directrices sur les pratiques ouvertes de l'APS stipulent qu'un badge Open Data nécessite « une URL, une DOI ou un autre chemin permanent pour accéder aux données dans un dépôt public à accès ouvert », avec une DOI (identifiant d'objet numérique) moins connue mais fonctionnant un peu comme un livre de numéros ISBN, en se lier aux URLs avec l'idée qu'une DOI pointera toujours vers un objet spécifique, comme un ensemble de données ou un article de journal, même si l'emplacement ou les caractéristiques de cet objet changent.
Les identifiants persistants permettent de citer et de localiser de façon fiable les ensembles de données, même lorsque les systèmes de dépôt changent. Les DOI sont les identifiants persistants les plus courants pour les données de recherche, mais d'autres systèmes comme les ARK (Archival Resource Keys) ou les Poignées peuvent également être appropriés.
Métadonnées de préservation
Les métadonnées de conservation documentent les renseignements nécessaires à la gestion des données à long terme, y compris la provenance, les détails techniques sur les formats de fichiers et les dépendances, les mesures de conservation prises et les renseignements sur les droits.
Ces métadonnées permettent aux futurs utilisateurs de comprendre l'historique des données, d'en évaluer l'authenticité et de déterminer les outils nécessaires pour y accéder.
Planification de la relève
Les projets de recherche et même les établissements peuvent ne pas exister indéfiniment, mais les données devraient les survivre. La planification de la relève identifie ce qui arrivera aux données lorsque les projets prendront fin, les chercheurs principaux prendront leur retraite ou les établissements fermeront.
Dépôt de données dans des dépôts fiables avec des plans de durabilité à long terme plutôt que de dépendre uniquement d'une infrastructure propre à un projet. Les dépôts fiables ont des structures de gouvernance, des modèles de financement et une infrastructure technique conçues pour une exploitation à long terme.
Mesure et amélioration de la performance du dépôt
L'amélioration continue exige la mesure du rendement du dépôt et l'utilisation de ces paramètres pour orienter les efforts d'amélioration.
Principaux indicateurs de rendement
Établir des indicateurs de performance clés (ICP) qui mesurent le succès du dépôt dans plusieurs dimensions. Les ICR techniques peuvent comprendre le temps de mise à jour du système, les vitesses de transfert de données, l'utilisation du stockage et les taux de succès de sauvegarde.
Les ICR de la sécurité surveillent les violations d'accès, les incidents de sécurité et la conformité aux vérifications. Les rapports réguliers sur ces mesures aident à cerner les tendances et les domaines nécessitant une attention particulière.
Commentaires et satisfaction des utilisateurs
Des enquêtes régulières et des mécanismes de rétroaction aident à comprendre les besoins des utilisateurs et à identifier les points de douleur dans les systèmes et les processus de dépôt.
Les tests d'utilisation peuvent identifier les problèmes d'interface et les inefficacités du déroulement des opérations qui peuvent ne pas être apparentes à partir des seules statistiques d'utilisation.
Analyse comparative et pratiques exemplaires
Comparer le rendement des dépôts par rapport aux institutions de pairs et aux normes de l'industrie pour déterminer les domaines à améliorer.
Participer à des programmes de certification des dépôts comme CoreTrustSeal, qui fournit un cadre pour évaluer la fiabilité des dépôts et identifier les domaines à améliorer.
Bâtir une culture de la gérance des données
L'infrastructure et les politiques techniques sont nécessaires mais ne suffisent pas pour une gestion efficace des données.
Leadership et appui institutionnel
Un solide appui institutionnel est essentiel pour établir la gestion des données en priorité. Les dirigeants devraient préciser l'importance de la gérance des données, allouer des ressources adéquates et reconnaître les bonnes pratiques de gestion des données dans les décisions de promotion et de tenure.
Les politiques institutionnelles devraient établir des attentes claires en matière de gestion des données, y compris les exigences relatives aux plans de gestion des données, au partage des données et à la conservation à long terme.
Incitations et reconnaissance
Les chercheurs répondent aux incitatifs et la gestion des données concurrence d'autres demandes de temps et d'attention. La création d'incitatifs pour une bonne gestion des données aide à prioriser ces activités, notamment le financement des activités de gestion des données, le crédit pour les examens de promotion et de tenure, ou les prix reconnaissant une gestion exemplaire des données.
Rendre visible le partage et la réutilisation des données en suivant les citations de données, en mettant en évidence les recherches qui sont rendues possibles par des données partagées et en célébrant les chercheurs qui rendent leurs données disponibles, ce qui démontre la valeur du partage des données et encourage une plus grande participation.
Bâtiment communautaire
Favoriser les communautés de pratique autour de la gestion des données où les chercheurs peuvent partager leurs expériences, apprendre les uns des autres et élaborer des normes communes.
Faire appel à des communautés de gestion des données plus vastes par l'entremise d'organisations professionnelles, de conférences et de forums en ligne, ce qui permet d'accéder à l'expertise, aux pratiques exemplaires émergentes et aux possibilités de collaboration qui profitent aux efforts des dépositaires locaux.
Relever les nouveaux défis et les orientations futures
Le paysage de la gestion psychologique des données continue d'évoluer, ce qui présente de nouveaux défis et de nouvelles possibilités.
Données massives et méthodes informatiques
La recherche psychologique tire de plus en plus parti des mégadonnées de sources telles que les médias sociaux, les appareils mobiles et les plateformes en ligne. Ces ensembles de données massifs nécessitent une infrastructure évolutive, des outils d'analyse sophistiqués et de nouvelles approches de protection de la vie privée.
Les méthodes informatiques, y compris l'apprentissage automatique et l'intelligence artificielle, transforment la recherche psychologique. Les dépôts de données doivent soutenir ces méthodes en fournissant des ressources informatiques appropriées, en préservant le code d'analyse aux côtés des données et en documentant les approches algorithmiques.
Science ouverte et transparence
Les psychologues reconnaissent que la documentation des résultats d'une étude dans un document publié n'est pas toujours suffisante — plutôt que la recherche soit aussi reproductible que possible, les pratiques de recherche et les analyses statistiques doivent être transparentes, les données et les documents étant rendus publics et accessibles à d'autres chercheurs.
Le mouvement scientifique ouvert est à l'origine d'attentes accrues en matière de partage de données, d'enregistrement préalable et de transparence. Les dépôts doivent appuyer ces pratiques tout en répondant aux préoccupations légitimes concernant la vie privée, la propriété intellectuelle et l'éthique de la recherche.
Collaboration internationale et souveraineté des données
La recherche psychologique implique de plus en plus de collaborations internationales, mais les règlements sur la souveraineté des données peuvent restreindre les lieux où les données peuvent être stockées et la façon dont elles peuvent être transférées de part et d'autre des frontières.
Les modèles de dépôt fédérés, où les données demeurent dans leur pays d'origine mais peuvent être découverts et analysés par des systèmes distribués, peuvent offrir des solutions aux problèmes de souveraineté des données, qui nécessitent une infrastructure technique sophistiquée et des cadres de gouvernance.
Considérations éthiques en matière de réutilisation des données
Le consentement initial n'a peut-être pas anticipé toutes les utilisations possibles, en particulier pour les technologies et méthodes émergentes. Les dépôts doivent être en mesure de permettre une réutilisation bénéfique tout en respectant l'autonomie des participants et les limites du consentement initial.
Les modèles dynamiques de consentement, où les participants peuvent mettre à jour leurs préférences au fil du temps, et les cadres généraux de consentement qui prévoient des utilisations futures peuvent aider à relever ces défis.
Ressources et apprentissages ultérieurs
De nombreuses ressources sont disponibles pour soutenir la gestion des dépôts de données psychologiques. Des organisations professionnelles comme l'American Psychological Association fournissent des conseils sur la gestion et le partage des données. Les ressources APA pour le partage des données offrent des conseils pratiques aux chercheurs.
Le Consortium interuniversitaire pour la recherche politique et sociale offre des documents de formation, des webinaires et des ateliers sur des sujets de gestion des données.
L'initiative GO FAIR fournit des ressources pour la mise en oeuvre des principes de données FAIR, y compris du matériel de formation, des outils et du soutien communautaire.
Les communautés de gestion des données de recherche comme l'Alliance des données de recherche rassemblent des praticiens du monde entier pour élaborer des normes, partager les pratiques exemplaires et relever des défis communs.
Conclusion
La gestion efficace des dépôts de données psychologiques à grande échelle exige une approche globale qui intègre une infrastructure technique solide, des politiques de gouvernance claires, la conformité réglementaire, les processus d'assurance de la qualité et une culture de gestion des données. Les pratiques décrites dans ce guide fournissent un cadre pour l'élaboration et la tenue de dépôts qui protègent la vie privée des participants, assurent la qualité des données, facilitent la collaboration en recherche et maximisent la valeur à long terme des données de recherche psychologique.
Le succès exige un engagement continu de la part du leadership institutionnel, une affectation adéquate des ressources, un personnel bien formé et une participation à la collectivité de la gestion des données. À mesure que les technologies évoluent, que les règlements changent et que les pratiques de recherche progressent, les stratégies de gestion des dépôts doivent s'adapter en conséquence.
L'investissement dans une bonne gestion des données est rentable grâce à une reproductibilité accrue de la recherche, à des possibilités de collaboration accrues, à une plus grande incidence de la recherche et à une meilleure gestion de la ressource précieuse que les participants à la recherche fournissent grâce à leur participation.