Comment transformer de vieux journaux intimes en archives interrogeables
Pour rendre d'anciens journaux intimes interrogeables, conservez chaque page originale sous forme d'image lisible, générez du texte par OCR ou transcription minutieuse, puis reliez chaque page à une date, un volume et un identifiant de page stables. Ajoutez un ensemble restreint et cohérent d'étiquettes (tags) et vérifiez les dates et mots incertains par rapport à l'image. Le but est de trouver le bon passage et de revenir à sa page source — non de rendre chaque entrée visuellement parfaite ou de réécrire le journal.\n\nCe guide s'adresse à toute personne possédant déjà des journaux papier ou des numérisations et souhaitant effectuer des recherches par date, nom, lieu ou sujet. La méthode ci-dessous distingue les fichiers de conservation des outils d'aide à la recherche, afin que les erreurs d'OCR et les modifications ultérieures n'effacent pas ce qui est réellement écrit sur la page.
Déterminez ce à quoi un résultat de recherche doit vous mener
Avant de numériser ou d'étiqueter, notez les recherches que vous prévoyez d'effectuer. Par exemple : « afficher les entrées de mars 1998 », « trouver chaque mention de l'ancien appartement » ou « ouvrir la page où j'ai parlé du voyage en train ». Celles-ci impliquent des besoins différents : les dates nécessitent des champs de date cohérents, les sujets demandent des étiquettes ou du texte interrogeable, et la recherche au niveau de la page exige des références de page stables.
Choisissez la plus petite unité qui reste pertinente. Un journal comportant une entrée datée par page peut être géré à raison d'un enregistrement par page. Si les entrées s'étendent sur plusieurs pages, considérez l'entrée comme l'enregistrement et conservez les identifiants de sa première et de sa dernière page. Si la date est incertaine ou qu'une entrée se poursuit au-delà d'une coupure, consignez cette incertitude plutôt que de deviner. Un identifiant stable tel que D03-p014 peut désigner le volume 3, page 14, même si vous renommez ultérieurement les fichiers images.
Il s'agit d'un choix de conception pratique, et non d'une règle archivistique absolue. Les ressources d'archivage personnel de la Library of Congress comprennent des conseils sur la numérisation des collections personnelles et la préservation des documents numériques ; ses recommandations plus générales rappellent que les contenus numériques dépendent de la technologie pour rester accessibles (Library of Congress, Personal Digital Archiving). C'est pourquoi un enregistrement de recherche doit renvoyer à l'image d'une page et que vous devez conserver une copie exploitable du scan d'origine.
Étape 1 : Établir un inventaire avant le traitement
Listez les journaux et les volumes dans leur ordre physique. Notez le libellé du volume, la période approximative, si les pages sont numérotées, ainsi que les lacunes ou les encarts dont vous avez déjà connaissance. Ne faites pas dépendre l'inventaire de l'exhaustivité des dates : un carnet aux dates inconnues a tout de même sa place dans la séquence.
Utilisez des noms de fichiers descriptifs et stables reliés à l'inventaire, par exemple D03_p014_master.tif pour une image et D03_p014.txt pour sa transcription. Conservez le même format d'identifiant d'un bout à l'autre. N'utilisez pas une date comme unique clé de nom de fichier ; une entrée peut ne pas avoir de date, avoir une date incertaine ou une date corrigée par la suite. Si vous fractionnez le travail sur plusieurs séances, marquez la dernière page traitée dans l'inventaire afin de repérer facilement les manques et les doublons.
Étape 2 : Capturer les pages pour permettre la vérification du texte
Numérisez ou photographiez les pages dans l'ordre de lecture, y compris les pages blanches ou délibérément sautées lorsque leur emplacement importe. Conservez la page entière dans le champ, évitez de rogner les notes marginales et assurez-vous que l'écriture soit lisible sur l'image capturée. Si une page est fragile, ne l'aplatissez pas et n'appuyez pas dessus au risque de l'endommager ; adaptez la méthode de capture ou demandez conseil à un spécialiste de la conservation pour les documents précieux ou délicats.
Conservez une image de page de haute qualité comme copie de référence et créez des dérivés plus légers ou interrogeables selon vos besoins. La Library of Congress fournit des conseils sur la numérisation personnelle dans le cadre de ses ressources d'archivage. Les directives de numérisation de la NARA sont rédigées pour les archives fédérales et non pour les journaux personnels, mais elles précisent que la qualité de la numérisation et sa gestion font partie intégrante d'un processus de conversion fiable (ressources de numérisation de la NARA). La leçon pratique pour une collection personnelle est simple : examinez des images représentatives et inspectez les pages floues, tronquées, de travers ou difficiles à lire avant de vous fier à leur texte.
Étape 3 : Ajouter l'OCR, puis la vérifier par rapport à l'image
L'OCR peut transformer les images de pages imprimées ou manuscrites en texte interrogeable par ordinateur, si l'outil choisi prend en charge l'écriture et le style manuscrit. Considérez son résultat comme un outil de repérage et non comme une transcription certifiée. Les écritures anciennes, l'encre effacée, les orthographes inhabituelles, les abréviations, les ajouts et les détériorations de la page peuvent entraîner des mots erronés ou manquants. Une recherche qui ne donne rien ne prouve pas qu'un mot est absent du journal.
Traitez d'abord un petit échantillon. Choisissez des pages représentatives de la collection : écriture claire, écriture serrée, stylos ou papiers différents, et tout texte non rédigé en anglais. Vérifiez si le résultat est exploitable et si l'outil reconnaît la langue et le système d'écriture. Si l'OCR n'est pas fiable, ne transcrivez que les entrées ou les pages sur lesquelles vous êtes le plus susceptible de faire des recherches, ou adoptez une approche hybride : conservez l'image, saisissez une courte transcription vérifiée manuellement et signalez les mots incertains. Ne « corrigez » pas silencieusement l'orthographe d'un auteur et ne développez pas les abréviations ; si vous normalisez un terme pour faciliter la recherche, conservez le texte d'origine et étiquetez la version normalisée séparément.
Pour le contrôle qualité, inspectez chaque ligne d'OCR contenant un nom important, une date ou un terme de recherche sur lequel vous prévoyez de vous appuyer. Si vous ne pouvez pas vérifier chaque ligne, marquez la transcription comme non révisée et notez la section qui a été relue. Rendez les doutes visibles à l'aide d'une convention telle que [?] ou [illisible], et reliez le texte incertain à l'image de la page. Votre archive reste utile même si la transcription est incomplète, pourvu que vous puissiez voir ce qui a été vérifié et ce qui ne l'a pas été.
Étape 4 : Utiliser une fiche de métadonnées synthétique
Attribuez à chaque page ou entrée une fiche concise comportant des champs qui facilitent sa localisation et son interprétation. Voici une base de départ pratique :
Cette structure s'inspire des principes courants des métadonnées descriptives, sans pour autant exiger l'adoption d'une norme rigide. Le guide de l'utilisateur de la Dublin Core Metadata Initiative détaille des propriétés telles que le titre, l'identifiant, le sujet, la date, la description et les droits, et explique comment définir les valeurs de métadonnées (DCMI, Creating Metadata). Pour l'index d'un journal intime privé, ces concepts se traduisent par un titre ou un libellé d'entrée, un identifiant stable, des sujets utiles, des dates et des notes d'accès. Vous pouvez commencer avec un tableur ; une base de données dédiée n'est pas nécessaire, à moins que la collection ou vos besoins de recherche ne le justifient.
Séparez ce que le journal indique de votre propre interprétation. Par exemple, notez Date telle qu'écrite : 4/5 et Date normalisée : inconnue si vous ne savez pas si la date signifie le 5 avril ou le 4 mai. Une mention comme probablement printemps 2001 a sa place dans un champ de déduction, pas dans le champ de la date d'origine. Cette distinction permet des corrections ultérieures sans modifier les données sources.
Étape 5 : Choisir des étiquettes pour la recherche, non pour une description exhaustive
Commencez par un vocabulaire restreint correspondant aux recherches probables : personnes, lieux, activités récurrentes, projets ou événements précis. Utilisez systématiquement la même orthographe et prévoyez des alias lorsqu'une personne ou un lieu apparaît sous plusieurs noms. Une étiquette doit faciliter la recherche de documents ; elle n'a pas besoin de résumer l'intégralité d'une page.
Évitez de créer une nouvelle étiquette pour chaque formule. Si « train », « chemin de fer » et « le 6h10 » font tous référence au même sujet récurrent dans vos notes, déterminez si vous avez besoin d'une étiquette normalisée unique telle que voyage en train, tout en conservant la formulation d'origine dans la transcription. N'ajoutez pas d'étiquettes descriptives délicates qui n'aident en rien la recherche visée. Pour les requêtes thématiques, la recherche en texte intégral peut suffire ; les étiquettes manuelles sont surtout utiles lorsque l'OCR est défaillante ou lorsqu'il faut rassembler des passages apparentés malgré des formulations variées.
Étape 6 : Tester les recherches et corriger les points faibles
Faites quelques essais de recherche réels correspondant à vos objectifs : une date exacte, une personne, un lieu, un sujet récurrent et une expression que l'OCR pourrait mal interpréter. Vérifiez que chaque résultat vous renvoie à la bonne image et à la bonne page. Si une recherche manque un passage connu, cherchez-en la raison : le champ de date est peut-être incohérent, le nom comporte des variantes, l'OCR a échoué ou le résultat est dissimulé dans une note non indexée.
Servez-vous de cet échec pour corriger la partie concernée du système, et non pour ajouter des métadonnées de manière désordonnée. Ajoutez un alias pour le nom d'une personne si cela résout une recherche récurrente. Corrigez l'OCR lorsque l'image source permet une lecture claire. Ajoutez une note au niveau de la page si une entrée s'étend sur plusieurs pages. Tenez un court journal de traitement répertoriant les pages vérifiées, les corrections apportées et les points en suspens ; cela vous évitera de confondre un résultat de recherche réellement négatif avec une section non encore traitée.
Confidentialité, limites et seuil d'achèvement
Une copie texte interrogeable peut rendre le contenu d'un journal plus facilement exposé qu'un carnet fermé. Avant d'utiliser un service d'OCR dans le cloud ou une archive partagée, demandez-vous si les conditions de stockage, d'accès et de suppression correspondent à vos attentes. Si les documents doivent rester privés, privilégiez une méthode maintenant les images et les textes sous votre contrôle exclusif. Pour un accès partagé, déterminez quels volumes ou champs peuvent être montrés ; un index de recherche n'a pas à tout dévoiler.
Ne jetez pas les journaux papier simplement parce qu'ils ont été numérisés. Un scan préserve la vue d'une page, tandis que l'OCR n'est qu'un texte dérivé d'aide à la recherche susceptible de contenir des erreurs. De même, ce système ne peut garantir que chaque mot manuscrit deviendra interrogeable. Sa qualité dépend de l'état des pages, de la lisibilité des prises de vue, de l'écriture manuscrite, de la prise en charge de la langue et du niveau de relecture que vous fournissez.
Un seuil d'achèvement raisonnable est atteint lorsque chaque page du journal dispose d'une référence stable, que les dates et étiquettes nécessaires à vos recherches sont cohérentes et qu'un échantillon de résultats de recherche importants mène bien à la bonne page. Commencez par un volume, éprouvez la méthode, puis étendez-la au reste. Conservez l'image, signalez clairement les textes douteux comme tels, et laissez les métadonnées faire juste le nécessaire pour retrouver le passage souhaité au moment voulu.
