Documentanalyse
Documentanalyse is het proces waarbij documenten worden geanalyseerd om betekenisvolle gegevens te extraheren. De term wordt vaak in verband gebracht met computerhacking, omdat hackers documenten kunnen "doorzoeken" om vertrouwelijke gegevens bloot te leggen. Documentanalyse wordt echter ook voor niet-kwaadwillige doeleinden gebruikt. Voorbeelden hiervan zijn het identificeren van onbekende bestandstypen en het bekijken van metagegevens van bestanden.
Documentanalyse kan worden uitgevoerd op zowel platte tekst als binaire bestanden.
Tekstbestanden
Het doorzoeken van tekstbestanden is een eenvoudig proces, omdat ze gegevens als platte tekst opslaan. U kunt binnen een tekstdocument zoeken naar tekens en tekenreeksen met een hulpprogramma zoals grep of een ander zoekprogramma. Omdat tekstverwerking een relatief snelle computerbewerking is, kunnen mogelijk meerdere grote documenten in minder dan een seconde worden doorzocht.
Veelvoorkomende typen tekstbestanden die bij documentanalyse worden onderzocht, zijn logbestanden (.LOG, .TXT) en configuratiebestanden (.CONF, .CNF). Als een hacker bijvoorbeeld toegang krijgt tot een webserver, kan deze in deze bestanden zoeken naar gebruikersnamen, wachtwoorden en andere vertrouwelijke gegevens.
Binaire bestanden
Binaire bestanden kunnen platte tekst bevatten, maar slaan ook binaire gegevens op — enen en nullen. Het is moeilijker om binaire gegevens te doorzoeken, omdat er niet met een tekstzoekprogramma in kan worden gezocht. Bovendien worden veel binaire bestanden opgeslagen in een eigen bestandsindeling, die zonder de bijbehorende toepassing moeilijk te parseren is. Daarom richt documentanalyse van binaire bestanden zich doorgaans op de kop en voettekst van een document, die platte tekst kunnen bevatten. Het doel kan ook zijn om metagegevens van bestanden te extraheren.
Veel binaire bestanden bevatten in de kop van het bestand informatie over het bestandstype. In de voorbeeldafbeelding geven de letters "PNG" in de kop bijvoorbeeld aan dat het bestand een PNG-afbeelding is. Deze informatie is nuttig voor het identificeren van het bestandstype als het geen bestandsextensie heeft. Digitale foto's bevatten vaak vergelijkbare verborgen EXIF-gegevens die worden opgeslagen wanneer de foto wordt gemaakt. Een programma voor het bekijken van afbeeldingen of een script voor documentanalyse kan deze informatie mogelijk detecteren en extraheren.
Test je kennis