Analyse de documents
L’analyse de documents est le processus qui consiste à analyser des documents pour en extraire des données utiles. Ce terme est souvent associé au piratage informatique, car les hackers peuvent « analyser » des documents pour révéler des données confidentielles. Cependant, l’analyse de documents est également utilisée à des fins légitimes. Elle peut notamment servir à identifier des types de fichiers inconnus et à consulter les métadonnées des fichiers.
Il est possible d’effectuer une analyse de documents aussi bien sur des fichiers en texte brut que sur des fichiers binaires.
Fichiers texte
L’analyse des fichiers texte est un processus simple, car ceux-ci stockent les données sous forme de texte brut. Vous pouvez rechercher des caractères et des chaînes de caractères dans un document texte à l’aide d’un outil comme grep ou d’un autre utilitaire de recherche. Comme le traitement de texte est une opération informatique relativement rapide, il peut être possible d’analyser plusieurs documents volumineux en moins d’une seconde.
Les types de fichiers texte couramment ciblés par l’analyse de documents comprennent les fichiers journaux (.LOG, .TXT) et les fichiers de configuration (.CONF, .CNF). Si un hacker accède à un serveur web, par exemple, il peut rechercher dans ces fichiers des noms d’utilisateur, des mots de passe et d’autres données confidentielles.
Fichiers binaires
Les fichiers binaires peuvent contenir du texte brut, mais ils stockent également des données binaires — des 1 et des 0. Il est plus difficile d’analyser des données binaires, car il n’est pas possible d’y effectuer des recherches avec un outil de recherche textuelle. De plus, de nombreux fichiers binaires sont enregistrés dans un format de fichier propriétaire, qu’il est difficile d’analyser sans l’application correspondante. Par conséquent, l’analyse de documents binaires se concentre généralement sur l’en-tête et le pied de page d’un document, qui peuvent contenir du texte brut. Elle peut également viser à extraire les métadonnées du fichier.
De nombreux fichiers binaires contiennent des informations sur le type de fichier dans l’en-tête du fichier. Par exemple, dans l’image d’exemple, les lettres « PNG » dans l’en-tête indiquent que le fichier est une image PNG. Ces informations sont utiles pour identifier le type de fichier, car celui-ci ne possède pas d’extension de fichier. De même, les photos numériques contiennent souvent des données EXIF masquées, enregistrées au moment où la photo a été prise. Un programme d’affichage d’images ou un script d’analyse de documents peut être capable de détecter et d’extraire ces informations.
Testez vos connaissances