Forrige uke sjekket jeg metadataene i en PDF jeg var på vei til å sende. Den inneholdt fortsatt mitt fulle navn, bedriftens interne filbane og det eksakte tidsstempelet for hver revisjon jeg hadde gjort den siste måneden.

Siden så ren ut. Filen var det ikke.

De fleste åpner aldri egenskapspanelet i en PDF før de deler den. Det synlige innholdet får all oppmerksomheten. Men selve filen kan si mye mer enn det som står på siden, og det skjulte laget er det dette innlegget handler om.

Det korte svaret

PDF-metadata kan inneholde navnet ditt, programvaren du brukte, tidsstempler for opprettelse og endring, revisjonshistorikk, kommentarer og til og med GPS-koordinater fra innebygde bilder.

For å fjerne dem har du noen alternativer:

  • bruk en metadataredigerer eller et saneringsverktøy for å fjerne bestemte felt
  • bruk et kommandolinjeverktøy som exiftool for full kontroll
  • konverter PDF-en til en skannet, bildebasert fil, som erstatter hele dokumentstrukturen og fjerner all skjult data på én gang

Hvis dokumentet er ferdig og skal ut av organisasjonen din, er det siste alternativet det mest grundige enkelttiltaket du kan ta.

Hva PDF-metadata faktisk inneholder

En PDF kan bære på tre informasjonslag utover det du ser på siden.

Det første laget er dokumentegenskaper. Dette er de metadataene de fleste tenker på: forfatternavn, tittel, emne, opprettelsesdato, endringsdato og programvaren som produserte filen. Åpne en hvilken som helst PDF i en visning, sjekk Fil > Egenskaper, og du vil trolig se felt som "Forfatter: Jane Smith" og "Produsent: Microsoft Word 2021." Den informasjonen følger med filen uansett hvor den går.

Det andre laget er XMP og innebygd metadata. Dette er mindre synlig, men ofte mer avslørende. Hvis PDF-en din inneholder innebygde bilder, kan disse bildene fortsatt bære sine opprinnelige EXIF-data, inkludert kameramodell, tidsstempler og GPS-koordinater. XMP-metadata kan også inneholde redigeringshistorikk, egendefinerte tagger og informasjon om skriftlisensiering. De fleste vet ikke at dette laget finnes, fordi standard PDF-visere ikke viser det.

Det tredje laget er skjulte strukturelle data. Avhengig av hvordan PDF-en ble opprettet og redigert, kan filen inneholde revisjonshistorikk, slettet-men-gjenopprettbar tekst, kommentarer, merknader, standardverdier for skjemafelt, skjulte lag, JavaScript og innebygde filvedlegg. Dette er laget som forårsaker mest skade når det lekker, fordi det kan inneholde innhold forfatteren trodde de hadde fjernet.

Hvis du allerede har tenkt på denne typen skjulte data i forbindelse med å laste opp filer til nettbaserte verktøy, dekker Er det trygt å bruke nettbaserte PDF-verktøy for sensitive dokumenter? den bredere tillitsmodellen.

Hvorfor dette betyr mer enn folk tror

Metadatalekkasjer er ikke dramatiske. De er stille, spesifikke og vanskelige å reversere når filen først er delt.

Forfatteridentifikasjon når anonymitet er viktig. Hvis PDF-en ble opprettet av en bestemt person, kan forfatterfeltet eller den interne filbanen føre tilbake til vedkommende. Dette er relevant for varslere, anonyme rapporter, lekkede dokumenter, eller enhver situasjon der avsenderens identitet skal holdes utenfor filen.

Revisjonshistorikk avslører forhandlingsstrategi. En kontrakts-PDF som fortsatt inneholder sporede endringer eller revisjonsmetadata, kan avsløre utgangsposisjonen din, hva du strøk, og hva du mildnet før du sendte den endelige versjonen. Motparten trenger ikke være teknisk kyndig for å snuble over dette. Enkelte PDF-visere viser revisjonsdata automatisk.

Tidsstempler avslører sensitiv timing. Opprettelses- og endringsdatoer forteller noen når dokumentet ble påbegynt, når det sist ble endret, og hvor mange ganger det ble rørt. I juridiske sammenhenger, etterlevelsessammenhenger eller konkurransesammenhenger kan den typen tidsinformasjon bety mer enn selve innholdet.

GPS-koordinater fra innebygde bilder. Hvis du limte inn et bilde i PDF-en og det bildet fortsatt bærer EXIF-posisjonsdata, er GPS-koordinatene for hvor bildet ble tatt nå innebygd i filen. De fleste tenker ikke på dette fordi metadataene ligger inne i bildeobjektet, ikke i PDF-egenskapspanelet.

Programvareversjoner avslører interne verktøy. Felt som "Produsent: Adobe Acrobat Pro DC 24.1.30225" eller "Skaper: Microsoft Word for Microsoft 365" forteller noen hvilke verktøy og versjoner organisasjonen din bruker. For de fleste dokumenter er dette trivielt. I sensitive sammenhenger er det et unødvendig informasjonslekk.

Ingen av disse er hypotetiske. De er de kjedelige metadatalekkasjene som faktisk skjer.

Slik sjekker du hvilke metadata PDF-en din inneholder

Før du fjerner noe, se på hva som faktisk finnes i filen.

Egenskapsdialogen i PDF-visningen. I de fleste PDF-lesere viser Fil > Egenskaper eller Dokumentegenskaper de grunnleggende feltene: forfatter, tittel, emne, opprettelsesdato, endringsdato og produsentprogram. Dette fanger opp det første laget, men går glipp av nesten alt annet.

exiftool på kommandolinjen. Å kjøre exiftool document.pdf viser deg alt: dokumentegenskaper, XMP-data, innebygd bilde-EXIF og egendefinerte felt. Dette er den mest komplette inspeksjonsmetoden, men den krever at du er komfortabel med en terminal. Hvis du aldri har brukt det før, er det verdt å installere det bare for å se hva en enkelt PDF kan inneholde.

Nettbaserte metadata-visere. Enkelte nettsteder lar deg laste opp en PDF for å inspisere metadataene. Hvis grunnen til at du sjekker metadata er personvern, er det et tvilsomt trekk å laste opp filen til en tredjepartstjeneste for å inspisere den. Du prøver å finne ut om filen lekker informasjon, og det første steget er å sende den til en fremmed.

Når du vet hva som er i filen, er spørsmålet hvordan du fjerner det.

Metoder for å fjerne PDF-metadata

Det finnes ingen enkelt beste metode. Det riktige valget avhenger av hva du trenger å beholde og hvor grundig du må være.

Adobe Acrobat (Rens dokument)

Acrobat Pro har funksjonene "Fjern skjult informasjon" og "Rens dokument", som kan fjerne metadata, skjult tekst, kommentarer, skjemadata, vedlegg og annet ikke-synlig innhold. Dette er en av de mest komplette metodene hvis du trenger å beholde tekstlaget intakt og filen søkbar.

Begrensningen er at det krever en betalt Acrobat Pro-lisens. Hvis du allerede har den, er dette et sterkt alternativ. Hvis ikke, er dette ikke den typen problem som alene rettferdiggjør abonnementet.

exiftool og andre CLI-verktøy

exiftool kan kirurgisk fjerne bestemte metadatafelt eller fjerne alt fra en PDF med én kommando. Det er gratis, kjører på enhver plattform, og gir presis kontroll over nøyaktig hva som fjernes.

Begrensningen er den tekniske terskelen. Det fokuserer også på metadatafelt fremfor strukturelle skjulte data. Hvis PDF-en inneholder revisjonshistorikk, skjulte lag eller innebygde objekter, vil ikke exiftool fange opp disse. Det er utmerket til det det gjør, men det dekker ikke alle lag.

Nettbaserte verktøy for fjerning av metadata

Flere nettsteder lar deg laste opp en PDF, fjerne metadataene og laste ned den rensede versjonen. Arbeidsflyten er enkel og krever ingen programvareinstallasjon.

Begrensningen burde være åpenbar. Du laster opp et dokument til en tredjepartsserver for å løse et personvernproblem. Det er litt som å gi dagboken din til en fremmed, slik at de kan rive ut siden med adressen din på.

Hvis filen har lav risiko, kan det være en akseptabel avveining. Hvis du fjerner metadata fordi dokumentet er sensitivt, introduserer denne metoden nettopp den typen eksponering du prøver å unngå. For mer om den avveiningen dekker Er det trygt å bruke nettbaserte PDF-verktøy for sensitive dokumenter? det i detalj.

Skriv ut til PDF

Å skrive ut en PDF på nytt gjennom en virtuell skriver oppretter en ny fil som ofte fjerner noe metadata og flater ut enkelte elementer. Det er gratis og innebygd i de fleste operativsystemer.

Resultatene er inkonsekvente. Noen virtuelle skrivere setter inn sine egne metadata i resultatet. Noen fjerner XMP-data, andre ikke. Innebygd bilde-EXIF kan overleve rundturen eller ikke. Hvis du bruker denne metoden, bør du alltid verifisere resultatet i stedet for å anta at det er rent.

Konvertering til en skannet PDF

Denne metoden konverterer hver side i PDF-en til et bilde, og pakker deretter disse bildene inn i en ny PDF. Fordi hele dokumentstrukturen erstattes, fjernes alle skjulte data: metadata, tekstlag, kommentarer, revisjonshistorikk, innebygde filer, skjemafelt, JavaScript, alt. Resultatet er en ny PDF som bare inneholder gjengitte sidebilder.

Avveiningen er at filen ikke lenger er tekstsøkbar. Den oppfører seg som et bilde av hver side. For dokumenter som er ferdige og skal ut av organisasjonen din, er den avveiningen ofte verdt det. For dokumenter som fortsatt må kunne søkes i, siteres eller redigeres videre, er det ikke det.

Det er jobben Look Scanned gjør. Den konverterer PDF-en til en skannet versjon lokalt i nettleseren din, slik at filen aldri forlater enheten din. Resultatet er en ren, bildebasert PDF uten skjulte data, uten tekstlag, uten metadata fra originalen, og uten serverbehandling å bekymre seg for.

Sammenligning

Metode Fjerner dokumentegenskaper Fjerner skjulte lag Fjerner bilde-EXIF Beholder tekstsøkbarhet Krever opplasting Kostnad
Adobe Acrobat (Rens dokument) Ja Ja Avhenger av innstillinger Ja Nei Betalt
exiftool / CLI Ja Delvis Ja Ja Nei Gratis
Nettbaserte metadataverktøy Vanligvis Vanligvis ikke Noen ganger Ja Ja Gratis
Skriv ut til PDF Delvis Delvis Noen ganger Vanligvis Nei Gratis
Skannet konvertering (f.eks. Look Scanned) Ja Ja Ja Nei Nei (lokal nettleser) Gratis

Ingen enkelt rad er perfekt for enhver situasjon. Spørsmålet er alltid hvilke avveininger som betyr noe for akkurat denne filen.

Når hver metode passer

Dokumentet er fortsatt under arbeid. Fjern metadata med Acrobat eller exiftool. Behold tekstlaget. Fjerning av metadata på dette stadiet er husholdning, ikke hovedsaken.

Dokumentet er ferdig og skal ut av organisasjonen din. Hvis søkbarhet ikke er kritisk, er en skannet konvertering det mest grundige enkelttiltaket. Den fjerner alt i én omgang. Hvis filen fortsatt må være søkbar, bruk Acrobats Rens dokument-funksjon i stedet, og verifiser resultatet.

Dokumentet er svært sensitivt. Kombiner metoder. Håndter riktig sladding først, deretter opprydding i metadata, og til slutt en avsluttende skannet konvertering. Hvert steg dekker et annet lag. Hvis sladding er en del av arbeidsflyten din, dekker Svarte striper er ikke sladding hvorfor visuell maskering ikke er nok.

Du er ikke sikker på hva som er i filen. Sjekk først med exiftool eller egenskapspanelet. Bestem deretter basert på hva du finner og hvor filen skal. Å velge en fjerningsmetode før du forstår hva som må fjernes, fører til enten overkill eller oversette data.

Hvis du vurderer om en skannet PDF er riktig format for situasjonen din, dekker Skannet PDF vs. redigerbar PDF: Hvilken bør du sende? den beslutningen mer generelt.

Arbeidsflyten jeg faktisk bruker

  1. Fullfør dokumentinnholdet først. Ikke rydd i metadata på en fil som fortsatt endres.
  2. Sjekk metadataene på den endelige eksporten. Minst Fil > Egenskaper. exiftool hvis det spiller en rolle.
  3. Fjern eller rens basert på hva jeg fant og hvor sensitiv destinasjonen er.
  4. Hvis filen skal ut og ikke trenger å være søkbar, konverterer jeg den til en skannet PDF. Look Scanned håndterer det steget i nettleseren uten å laste opp filen.
  5. Åpne resultatet i en ny visning og verifiser. Sjekk egenskaper, prøv å markere tekst, søk etter begreper som skal være borte.

Det siste steget fanger opp mer gjenværende data enn folk forventer.

Hvis flating er nok for situasjonen din og du ikke trenger den fullstendige skannede konverteringen, dekker Slik flater du ut en PDF før du sender den den mellomveien.

FAQ

Fjerner konvertering til en skannet PDF all metadata?

Ja. Konvertering til en bildebasert PDF erstatter hele filstrukturen. Resultatet inneholder ikke noe tekstlag, ingen skjulte objekter, ingen dokumentegenskaper fra originalen og ingen innebygd filmetadata. Resultatet er en ny PDF som bare inneholder gjengitte sidebilder.

Kan noen gjenopprette metadata fra en skannet PDF?

Ikke fra selve PDF-en. Den opprinnelige strukturen er borte. De eneste metadataene i den nye filen er det konverteringsverktøyet skriver, som sin egen produsenttagg. Hvis konverteringen skjer lokalt i nettleseren, finnes det heller ingen kopi på serversiden.

Er fjerning av metadata det samme som sladding?

Nei. Fjerning av metadata fjerner skjulte egenskaper og data på dokumentnivå. Sladding fjerner synlig innhold fra siden. Hvis du trenger å fjerne navn, tall eller tekst fra selve siden, er det et eget steg som må skje før opprydding i metadata. Svarte striper er ikke sladding forklarer hvorfor visuell maskering alene ikke holder.

Bør jeg fjerne metadata fra hver PDF jeg sender?

Ikke nødvendigvis. For rutinedokumenter som allerede er offentlige eller har lav risiko, er metadata ufarlig. Spørsmålet blir viktig når dokumentet er sensitivt, mottakeren er ekstern, eller forfatterens identitet skal holdes utenfor filen.

Avsluttende tanke

De fleste sjekker aldri hva PDF-en deres sier om dem før de sender den.

Filen kan være ren. Eller den kan inneholde navnet ditt, revisjonshistorikken din og GPS-koordinatene til kaféen der du redigerte den forrige tirsdag.

Hvis dokumentet betyr nok til å deles med omhu, betyr det nok til å sjekkes. Og hvis sjekken avslører mer enn du forventet, finnes det enkle måter å fikse det på før du trykker send.