Preskoči na sadržaj
SEO i brzina sajta

SEO za PDF dokumente: indeksiranje, naslovi i noindex

Google indeksira PDF fajlove i može da ih prikaže u rezultatima, ponekad umesto stranica vašeg sajta. Objašnjavamo kako pripremiti PDF za pretragu, kada je bolja HTML stranica i kako skloniti fajlove iz indeksa.

Ivan Petković 5 min čitanja
Sadržaj članka
  1. Da li Google indeksira PDF fajlove
  2. Kada je PDF dobar, a kada loš izbor
  3. Kako pripremiti PDF koji treba da bude u pretrazi
  4. HTML stranica kao glavna verzija
  5. Kako skloniti PDF iz pretrage: X-Robots-Tag
  6. Zaključak

Katalozi, cenovnici, tehnički listovi, uputstva i brošure na mnogim sajtovima postoje samo kao PDF fajlovi. Google ih može indeksirati i prikazati u rezultatima, ponekad čak bolje nego stranice sajta, a ponekad tako da posetilac završi u fajlu bez menija, kontakta i dugmeta za upit. SEO za PDF dokumente se svodi na dve odluke: koje PDF-ove želite u pretrazi i kako da ih pripremite, a koje treba skloniti iz indeksa. U ovom tekstu objašnjavamo oba slučaja.

Da li Google indeksira PDF fajlove

Da. Google obilazi PDF fajlove do kojih vode linkovi, čita njihov tekst i može da ih prikaže u rezultatima sa oznakom PDF. Linkovi unutar PDF-a se takođe mogu pratiti. Nekoliko stvari utiče na to koliko dobro to radi:

  • Tekstualni sloj. PDF napravljen izvozom iz Worda ili programa za dizajn sadrži pravi tekst. Skeniran dokument je u suštini slika; Google može pokušati da prepozna tekst, ali na to ne treba računati.
  • Dostupnost. Fajl mora biti dostupan bez lozinke i ne sme biti blokiran u robots.txt.
  • Linkovi ka fajlu. PDF do koga ne vodi nijedan link teško će biti otkriven.
  • Veličina. Veoma veliki fajlovi se sporije preuzimaju, a Google ne mora da obradi ceo sadržaj ogromnog dokumenta.

Kada je PDF dobar, a kada loš izbor

SadržajPreporukaZašto
Uputstvo za upotrebu, tehnički listPDF je u redu, uz HTML stranicu proizvodaKorisnici ga preuzimaju i štampaju
Cenovnik koji se često menjaHTML stranicaLakše ažuriranje, nema starih kopija u pretrazi
Katalog proizvodaHTML stranice proizvoda, PDF kao dodatakSvaki proizvod može da se rangira za svoju pretragu
Obrasci za popunjavanje i štampuPDFFormat je deo namene
Interni dokumenti, ugovoriNe javno, ili noindexNe pripadaju rezultatima pretrage

Glavni nedostatak PDF-a je to što posetilac iz pretrage dolazi u fajl, a ne na sajt. Nema navigacije, nema kontakt forme, analitika obično ne beleži šta je radio, a na telefonu se PDF teško čita. Zato je za sadržaj kojim želite da dobijete upite gotovo uvek bolja HTML stranica, a PDF samo verzija za preuzimanje.

Kako pripremiti PDF koji treba da bude u pretrazi

  1. Opisan naziv fajla. katalog-pvc-stolarija-2026.pdf umesto scan_0042.pdf. Koristite mala slova i crtice.
  2. Naslov u svojstvima dokumenta. Google za naslov rezultata često koristi polje Title iz metapodataka PDF-a, ili tekst sa prve strane. U Wordu se podešava u svojstvima fajla (Info, Properties), a u Acrobatu u svojstvima dokumenta.
  3. Pravi naslovi u dokumentu. Koristite stilove za naslove, a ne samo podebljan tekst; pri izvozu uključite strukturne oznake (tagged PDF), što pomaže i čitačima ekrana.
  4. Tekst, a ne slike teksta. Važne informacije ne smeju biti samo deo fotografije.
  5. Razumna veličina. Kompresujte slike pri izvozu; fajl od nekoliko megabajta je bolji od fajla od pedeset.
  6. Link sa sajta. Povežite PDF sa odgovarajuće stranice, sa jasnim tekstom linka i oznakom formata i veličine.

Naslov iz metapodataka igra sličnu ulogu kao meta naslov HTML stranice, pa važe ista pravila: kratko, jasno i opisno. Više o tome pisali smo u tekstu o meta naslovu i opisu. Strukturirani PDF je i deo pristupačnosti, o čemu govori tekst o osnovama WCAG pristupačnosti.

Kada objavite novu verziju dokumenta, na primer katalog za sledeću godinu, razmislite o adresi. Ako fajl uvek ostaje na istoj adresi, linkovi i signali koje je prikupio ostaju sačuvani. Ako svaka godina dobija novu adresu, staru verziju preusmerite na novu ili je jasno označite kao arhivu, kako kupci iz pretrage ne bi dobijali zastarele cene i podatke.

HTML stranica kao glavna verzija

Kada isti sadržaj postoji i kao stranica i kao PDF, oni se mogu takmičiti u pretrazi. Najbolje je da HTML stranica bude glavna verzija, a PDF dostupan za preuzimanje sa nje. Google-u to možete reći kroz canonical u HTTP zaglavlju PDF fajla, jer PDF nema HTML zaglavlje u koje bi se upisala oznaka. Primer za Apache server (.htaccess):

<Files "katalog-2026.pdf">
  Header set Link "<https://www.vasdomen.rs/katalog/>; rel=\"canonical\""
</Files>

Canonical je preporuka, a ne naredba, i važi samo ako je sadržaj stranice i PDF-a zaista suštinski isti. Detalje smo objasnili u tekstu o canonical tagu.

Kako skloniti PDF iz pretrage: X-Robots-Tag

Za PDF koji ne želite u rezultatima ne možete dodati meta oznaku robots, jer fajl nema HTML zaglavlje. Rešenje je HTTP zaglavlje X-Robots-Tag, koje server šalje uz fajl. Za sve PDF fajlove na Apache serveru:

<FilesMatch "\.pdf$">
  Header set X-Robots-Tag "noindex"
</FilesMatch>

Na Nginx serveru isto se postiže u konfiguraciji sajta:

location ~* \.pdf$ {
    add_header X-Robots-Tag "noindex";
}

Za Apache je potreban uključen modul mod_headers, što na većini deljenih hostinga jeste slučaj, ali proverite. Posle izmene, u alatima za programere u pregledaču (kartica Network) otvorite PDF i proverite da li se zaglavlje zaista šalje.

Česta greška: blokada u robots.txt

Ako PDF blokirate u robots.txt, Google ne može da ga preuzme, pa ne vidi ni oznaku noindex. Fajl koji je već u indeksu može ostati u rezultatima, samo bez opisa. Zato za uklanjanje koristite noindex i ostavite fajl dostupnim za obilazak dok ne nestane iz indeksa. Razliku između ova dva alata objasnili smo u vodiču za robots.txt i sitemap.xml. Za hitno, privremeno skrivanje postoji alat za uklanjanje u Search Console, ali on ne zamenjuje trajno rešenje. A ako je dokument poverljiv, noindex nije zaštita: fajl treba ukloniti sa servera ili ga zaštititi lozinkom.

Zaključak

PDF može da donese posetioce iz pretrage, ali najbolje radi kao dodatak HTML stranici, a ne kao njena zamena. Dajte fajlovima opisne nazive i naslove, izvozite ih sa pravim tekstom i strukturom, a one koji ne pripadaju pretrazi sklonite preko X-Robots-Tag zaglavlja. Ako ne znate koji vaši PDF-ovi su u indeksu i da li treba da budu, pošaljite nam upit i proverićemo to zajedno.

Česta pitanja

Kako da vidim koji PDF fajlovi sa mog sajta su u Google-u?

Okvirnu sliku daje pretraga site:vasdomen.rs filetype:pdf. Rezultat nije potpun ni tačan broj, ali pokazuje koje fajlove Google prikazuje. Za pojedinačan fajl pouzdaniji je alat za proveru adrese u Search Console.

Da li PDF može da se rangira bolje od stranice na sajtu?

Može, ako ima više relevantnog teksta ili više linkova ka sebi. Zato je za važan sadržaj najbolje imati HTML stranicu kao glavnu verziju, a PDF kao dodatak, uz canonical zaglavlje na PDF-u koje upućuje na stranicu.

Kako dodati noindex na PDF u WordPressu?

WordPress ne šalje zaglavlja za fajlove u folderu uploads, pa se X-Robots-Tag obično dodaje u .htaccess ili konfiguraciju servera. Neki SEO dodaci i hosting paneli nude to podešavanje, ali proverite rezultat u alatima za programere.

Da li Google čita skenirane PDF dokumente?

Skeniran dokument je slika bez tekstualnog sloja. Google može pokušati da prepozna tekst, ali je mnogo pouzdanije izvesti PDF iz izvornog dokumenta ili ga obraditi OCR alatom, kako bi tekst bio pravi i pretraživ.

#SEO za PDF#PDF dokumenti#X-Robots-Tag#noindex#indeksiranje

Podelite: Facebook LinkedIn WhatsApp