Skip to content
Fișierul robots.txt: la ce folosește și cum îl scrieți corect

Fișierul robots.txt: la ce folosește și cum îl scrieți corect

Fișierul robots.txt: la ce folosește și cum îl scrieți corect este întrebarea pe care și-o pun mulți proprietari de site atunci când descoperă acest fișier în rădăcina domeniului lor și nu știu dacă îl pot modifica în siguranță.

Un rând scris greșit poate ascunde întregul site din Google. Vă arătăm cum se scrie corect și cum verificați rezultatul.

Fișierul robots.txt: la ce folosește și cum îl scrieți corect

Fișierul robots.txt este un fișier text simplu, aflat la adresa numeledomeniului.ro/robots.txt, prin care transmiteți motoarelor de căutare ce părți din site pot fi parcurse automat și ce părți trebuie evitate.

Nu este un instrument de securitate, ci una dintre primele reguli tehnice pe care Googlebot le citește înainte de a intra pe site.

Ce este fișierul robots.txt și cum funcționează

Când un motor de căutare ajunge pe domeniul dumneavoastră, caută întâi acest fișier. Dacă îl găsește, respectă instrucțiunile din el înainte de a continua parcurgerea paginilor.

Fișierul nu împiedică o pagină să fie indexată dacă altcineva leagă spre ea din afara site-ului. Pentru a scoate definitiv o pagină din rezultatele căutării, se folosește eticheta noindex, nu robots.txt.

Diferența dintre robots.txt și eticheta noindex

Robots.txt spune unui robot să nu viziteze o adresă. Eticheta noindex, plasată în codul paginii, spune că adresa poate fi vizitată, dar nu trebuie păstrată în rezultatele căutării.

Cele două nu se combină. Dacă blocați o pagină în robots.txt, Google nu îi mai citește codul, deci nu vede nici eticheta noindex din interior. Pagina poate rămâne indexată cu o descriere goală, ceea ce arată neîngrijit în rezultatele căutării.

Robots.txt nu ascunde informații sensibile. Fișierul este public și oricine îl poate citi, deci nu îl folosiți pentru a proteja pagini cu date confidențiale. Pentru așa ceva este nevoie de o parolă sau de o restricție reală la nivel de server.

Legătura cu bugetul de crawlare

Motoarele de căutare alocă un număr limitat de vizite pentru fiecare site, cunoscut ca bugetul de crawlare. Un robots.txt bine scris direcționează aceste vizite spre paginile importante și le ține departe de zonele fără valoare, cum ar fi paginile de administrare sau filtrele de căutare interne. Explicăm pe larg acest mecanism în articolul despre crawl budget și cum îl optimizați.

Structura corectă a unui fișier robots.txt

Sintaxa are câteva reguli fixe, ușor de reținut odată ce le vedeți aplicate.

  • User-agent: precizează cărui robot i se adresează grupul de reguli, de exemplu Googlebot sau toate roboții, marcați cu asteriscul.
  • Disallow: indică o adresă sau un folder care nu trebuie parcurs.
  • Allow: permite explicit o adresă aflată în interiorul unui folder deja blocat.
  • Sitemap: indică adresa completă a sitemap-ului XML, astfel încât robotul să știe unde găsește lista de pagini.

Un exemplu simplu, potrivit pentru majoritatea site-urilor WordPress:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://www.exemplu.ro/sitemap_index.xml

Ordinea liniilor contează mai puțin decât claritatea lor. Fiecare grup de reguli începe cu linia User-agent și este urmat de directivele care i se aplică.

Reguli separate pentru mai mulți roboți

Puteți scrie grupuri diferite de reguli pentru roboți diferiți, de exemplu dacă doriți să blocați un robot de colectare a conținutului, dar să lăsați Googlebot liber.

User-agent: Googlebot
Disallow: /cautare/

User-agent: AhrefsBot
Disallow: /

Fiecare motor de căutare respectă doar grupul care i se adresează direct sau, în lipsa acestuia, grupul general marcat cu asterisc.

Greșeli frecvente care blochează indexarea

Cele mai costisitoare greșeli sunt cele care par inofensive la prima vedere.

  • Linia Disallow: / lăsată din greșeală după o migrare de site, care blochează absolut tot conținutul.
  • Blocarea folderelor cu fișiere CSS și JavaScript, ceea ce împiedică Google să vadă pagina așa cum o vede un vizitator real.
  • Lipsa liniei Sitemap, care obligă motorul de căutare să descopere singur structura site-ului, mai lent.
  • Folosirea greșită a asteriscului, care poate bloca accidental adrese care nu erau vizate.
  • Confuzia dintre Disallow și noindex, tratate ca și cum ar face același lucru.

După orice modificare, verificați numărul de pagini indexate în Google Search Console. O scădere bruscă apare de obicei imediat după o schimbare greșită în robots.txt. Explicăm pas cu pas această verificare în ghidul de utilizare Google Search Console.

Cum verificați și testați fișierul robots.txt

Înainte de a considera fișierul gata, parcurgeți câțiva pași simpli de verificare.

Verificarea directă în browser

Deschideți numeledomeniului.ro/robots.txt direct în browser și citiți conținutul. Dacă apare o pagină goală sau o eroare, fișierul nu este accesibil și trebuie corectat.

Verificarea în Google Search Console

Secțiunea de indexare din Search Console arată exact câte pagini au fost excluse din cauza regulilor din robots.txt. Este cel mai rapid mod de a confirma că fișierul face ce trebuie, nu mai mult.

Merită corelată această verificare și cu structura adreselor site-ului, descrisă în articolul despre structura URL optimizată pentru SEO, fiindcă adresele curate sunt mai ușor de gestionat corect în robots.txt.

Verificarea din linia de comandă

Dacă administrați site-ul de pe un server Linux sau printr-un cont de găzduire cu acces SSH, puteți verifica rapid fișierul fără să deschideți browserul. Comanda de mai jos arată codul de răspuns și tipul de conținut returnat de server.

curl -I https://numeledomeniului.ro/robots.txt

Un răspuns corect are codul 200 și antetul Content-Type: text/plain. Dacă vedeți un cod 404, fișierul nu există la adresa așteptată. Un cod 403 arată o problemă de permisiuni pe server, care merită verificată împreună cu administratorul găzduirii.

Un alt motiv frecvent pentru un robots.txt care nu funcționează corect este encodarea greșită a fișierului. Dacă îl creați într-un editor de text obișnuit și îl salvați cu un marcaj invizibil de început, cunoscut ca BOM, unele motoare de căutare pot citi greșit prima linie și pot ignora reguli întregi. Salvați fișierul ca text simplu, codificare UTF-8 fără BOM, pentru a evita această problemă.

Cât durează până se aplică o modificare

Google nu recitește robots.txt la fiecare vizită. Fișierul este ținut într-o formă memorată temporar, de regulă până la douăzeci și patru de ore, uneori mai mult pentru site-urile cu trafic redus. O modificare recentă nu se reflectă instant în Search Console, așa că nu trageți concluzii dintr-o verificare făcută la câteva minute după publicare.

Atenție la majuscule și la bara finală

Regulile din robots.txt fac diferența între litere mari și mici, spre deosebire de multe alte setări din WordPress. O linie Disallow: /Cautare/ nu blochează adresa /cautare/ scrisă cu literă mică. La fel, o bară de final lipsă sau în plus poate schimba complet ce anume este blocat, mai ales pentru foldere. Verificați exact cum apar adresele în browser înainte de a le copia în fișier.

Dacă site-ul are și un subdomeniu, de exemplu pentru un magazin online sau pentru o versiune de test, rețineți că regulile scrise pe domeniul principal nu se aplică automat și acolo. Fiecare subdomeniu are propriul robots.txt, la propria adresă, și trebuie verificat separat.

Fișierul robots.txt în WordPress

WordPress generează automat un robots.txt virtual, care nu există fizic pe server dar apare la accesarea adresei. Pentru a-l personaliza, aveți două variante.

  • Editarea din interfața unui plugin SEO, precum cele descrise în pluginurile WordPress esențiale pentru orice site, unde regulile se salvează fără acces direct la server.
  • Încărcarea unui fișier fizic prin FTP sau prin managerul de fișiere din cPanel, variantă recomandată dacă site-ul are nevoie de reguli mai specifice decât cele oferite de plugin.

Pentru varianta cu fișier fizic, îl creați local ca document text simplu, îl denumiți exact robots.txt și îl încărcați în folderul rădăcină al site-ului, de obicei public_html. Odată încărcat fizic, el înlocuiește versiunea virtuală generată automat de WordPress.

Dacă abia urmează să vă construiți site-ul, este util să stabiliți structura robots.txt încă din etapa de configurare inițială, descrisă în ghidul de creare a unui site WordPress de la zero.

Cazuri speciale, unde regulile standard nu sunt suficiente

Anumite tipuri de site au nevoie de reguli suplimentare, dincolo de exemplul simplu prezentat mai sus.

  • Magazin online: blocați paginile generate de filtre și de sortare, care creează mii de adrese aproape identice și consumă degeaba bugetul de crawlare, dar lăsați accesibile paginile de produs și de categorie.
  • Site multilingv: verificați ca regulile să nu blocheze accidental una dintre versiunile de limbă, mai ales dacă acestea sunt organizate pe subfoldere separate.
  • Site în dezvoltare sau de test: un subdomeniu de test trebuie blocat integral cu Disallow: /, ca să nu ajungă din greșeală indexat alături de site-ul principal.
  • Paginile de căutare internă: rezultatele căutării din interiorul site-ului nu aduc valoare în Google și pot fi blocate fără riscuri.

Când este nevoie de ajutor specializat

Pentru site-uri mici, un robots.txt corect scris rezolvă problema. Pentru site-uri mai complexe, cu mii de pagini sau cu un magazin online, regulile se leagă strâns de restul configurării tehnice descrise în ghidul complet de SEO tehnic.

Dacă nu sunteți sigur cum arată situația reală a site-ului dumneavoastră, un audit SEO arată exact ce blochează sau încetinește indexarea, inclusiv eventualele erori din robots.txt. Puteți citi și un exemplu concret de verificări tehnice în articolul despre auditul SEO tehnic pentru un site mic.

Un fișier robots.txt scris corect este un pas mic, dar cu efect direct asupra felului în care Google vede site-ul dumneavoastră. Dacă doriți sprijin pentru configurarea lui sau pentru restul optimizărilor tehnice, echipa noastră de optimizare SEO poate prelua verificarea completă. Ne puteți scrie oricând prin pagina de contact pentru o discuție despre situația site-ului dumneavoastră.

Despre autor

Dorel Tănase este specialist în optimizare SEO și web design, cu o experiență de peste 28 de ani în domeniul IT și 17 ani dedicați exclusiv promovării online. \r\n\r\nAbsolvent al Academiei de Studii Economice din București, specializarea Cibernetică (1995), a intrat în lumea tehnologiei în 1996 și a lansat primul său website, cisnet.ro, în 1997. Din 2007 se concentrează pe web design și optimizare pentru motoarele de căutare, iar prin GOAI Promovare a colaborat cu peste 600 de companii din România. \r\n\r\nDeține certificări Google Analytics și Google Ads, pe care le aplică în strategiile de promovare online dezvoltate pentru clienți din domenii variate.

Dorel Tănase este specialist în optimizare SEO și web design, cu o experiență de peste 28 de ani în domeniul IT și 17 ani dedicați exclusiv promovării online. \r\n\r\nAbsolvent al Academiei de Studii Economice din București, specializarea Cibernetică (1995), a intrat în lumea tehnologiei în 1996 și a lansat primul său website, cisnet.ro, în 1997. Din 2007 se concentrează pe web design și optimizare pentru motoarele de căutare, iar prin GOAI Promovare a colaborat cu peste 600 de companii din România. \r\n\r\nDeține certificări Google Analytics și Google Ads, pe care le aplică în strategiile de promovare online dezvoltate pentru clienți din domenii variate.

Back To Top