
Το αρχείο robots.txt είναι το πρώτο πράγμα που διαβάζει ο Googlebot πριν αγγίξει οποιαδήποτε σελίδα του site σας, και ένα λάθος σε αυτό μπορεί να εξαφανίσει ολόκληρο domain από τη Google μέσα σε ώρες. Στη Netstar το αντιμετωπίζουμε ως κρίσιμο σημείο ελέγχου κάθε στρατηγικής SEO, γιατί καμία άλλη γραμμή κώδικα δεν έχει τόσο μεγάλη εμβέλεια με τόσο λίγους χαρακτήρες. Η ομάδα Netstar SEO ελέγχει αυτό το αρχείο πρώτο σε κάθε technical audit, πριν καν κοιτάξει περιεχόμενο ή backlinks.
Το robots.txt δεν είναι εργαλείο ασφαλείας ούτε μηχανισμός απόκρυψης από το index. Είναι ένα απλό text file στη ρίζα του domain που δίνει οδηγίες crawling στα bots: ποια paths επιτρέπεται να επισκεφθούν και ποια όχι. Η παρανόηση αυτού του ρόλου είναι η αιτία των περισσότερων καταστροφών που βλέπουμε στην πράξη.
Σε αυτόν τον οδηγό αναλύουμε τη σύνταξη γραμμή προς γραμμή, τη ζωτική διάκριση ανάμεσα στο crawling και στο indexing, τα μοιραία λάθη που μπλοκάρουν CSS και JavaScript, και τον τρόπο που το αρχείο αλληλεπιδρά με το crawl budget και το sitemap. Ο στόχος είναι να αποκτήσετε απόλυτο έλεγχο πάνω στο τι επισκέπτεται η Google στο site σας.
Τι είναι το robots.txt και τι ρόλο παίζει στο SEO;
Το robots.txt είναι ένα απλό αρχείο κειμένου στη ρίζα του domain που δηλώνει στα search engine bots ποια μέρη του site επιτρέπεται να κάνουν crawl. Ελέγχει την πρόσβαση των crawlers, όχι το indexing, και είναι το πρώτο αρχείο που ζητά κάθε bot.
Το robots.txt ζει πάντα σε μία και μόνη θέση: στο https://domain.gr/robots.txt. Δεν λειτουργεί σε υποφακέλους και δεν αναγνωρίζεται αν βρίσκεται αλλού. Κάθε φορά που ο Googlebot ξεκινά crawl, ζητά πρώτα αυτό το URL για να δει αν επιτρέπεται να συνεχίσει.
Ο ρόλος του είναι καθαρά διαχειριστικός. Καθοδηγεί τους crawlers μακριά από περιοχές χωρίς αξία αναζήτησης — admin paths, internal scripts, search results, parametrized URLs — ώστε οι πόροι του crawler να επικεντρώνονται στο περιεχόμενο που μετράει. Δεν είναι firewall και δεν κρύβει τίποτα από κακόβουλα bots, που απλώς το αγνοούν.
Η εμβέλειά του είναι δυσανάλογη με το μέγεθός του. Ένα robots.txt λίγων γραμμών μπορεί να καθορίσει αν δεκάδες χιλιάδες σελίδες θα φτάσουν ποτέ στον crawler. Γι’ αυτό κάθε αλλαγή απαιτεί προσοχή: μια λάθος γραμμή Disallow: / μπλοκάρει ολόκληρο το site, και η ανάκαμψη παίρνει μέρες αφού η Google ξαναδιαβάσει το αρχείο και ξανακάνει crawl τις σελίδες. Στις υπηρεσίες SEO που παρέχουμε, ο έλεγχος αυτού του αρχείου γίνεται πάντα πριν από κάθε deployment.
Πώς γράφεται σωστά η σύνταξη του robots.txt για το SEO;
Η σύνταξη του robots.txt βασίζεται σε ομάδες κανόνων: μια γραμμή User-agent ορίζει σε ποιον crawler απευθύνεται η ομάδα, και κάτω από αυτήν οι γραμμές Disallow και Allow ορίζουν ποια paths μπλοκάρονται ή επιτρέπονται. Η σειρά και η ειδικότητα μετράνε.
Κάθε ομάδα ξεκινά με ένα User-agent. Το User-agent: * απευθύνεται σε όλα τα bots, ενώ το User-agent: Googlebot στοχεύει συγκεκριμένα τον crawler της Google. Μπορείτε να έχετε πολλές ομάδες, καθεμία με δικούς της κανόνες, και κάθε bot διαβάζει μόνο την πιο εξειδικευμένη ομάδα που το αφορά — δεν συνδυάζει κανόνες από διαφορετικές ομάδες.
Οι δύο βασικές directives είναι το Disallow και το Allow. Το Disallow: /private/ μπλοκάρει την πρόσβαση σε ολόκληρο τον φάκελο, ενώ το Allow: /private/public-file.html δημιουργεί εξαίρεση μέσα σε έναν μπλοκαρισμένο φάκελο. Όταν δύο κανόνες συγκρούονται, η Google ακολουθεί τον πιο εξειδικευμένο — δηλαδή αυτόν με το μεγαλύτερο μήκος path. Έτσι ένα Allow πιο μακρύ από ένα Disallow υπερισχύει, ανεξάρτητα από τη σειρά γραφής.
Δύο σύμβολα δίνουν ευελιξία. Ο wildcard αστερίσκος * ταιριάζει με οποιαδήποτε ακολουθία χαρακτήρων, οπότε το Disallow: /*? μπλοκάρει κάθε URL που περιέχει ερωτηματικό, δηλαδή όλα τα parametrized URLs. Το σύμβολο δολαρίου $ δηλώνει το τέλος του URL, οπότε το Disallow: /*.pdf$ μπλοκάρει αποκλειστικά αρχεία που τελειώνουν σε .pdf. Η λάθος χρήση αυτών των δύο συμβόλων είναι από τις συχνότερες αιτίες ακούσιου over-blocking, γι’ αυτό κάθε κανόνας με wildcard πρέπει να δοκιμάζεται πριν ανέβει live.
Γιατί το robots.txt ελέγχει το crawling και όχι το indexing στο SEO;
Το robots.txt εμποδίζει τον Googlebot να επισκεφθεί ένα URL, αλλά δεν το αφαιρεί από το index. Μια μπλοκαρισμένη σελίδα με εξωτερικά backlinks μπορεί να εμφανιστεί στα αποτελέσματα χωρίς περιγραφή, γιατί η Google ξέρει ότι υπάρχει χωρίς να την έχει διαβάσει.
Αυτή είναι η πιο παρεξηγημένη ιδιότητα του αρχείου. Το Disallow δρα πριν την επίσκεψη, στο στάδιο του crawling. Δεν δίνει καμία εντολή για το index. Επομένως, αν θέλετε μια σελίδα εκτός αποτελεσμάτων αναζήτησης, το robots.txt είναι λάθος εργαλείο — απλώς εμποδίζει την Google να δει το περιεχόμενο, ενώ το URL μπορεί να παραμείνει ορατό.
Το παράδοξο αποτέλεσμα είναι η σελίδα που εμφανίζεται με το μήνυμα ότι δεν υπάρχουν διαθέσιμες πληροφορίες για αυτό το URL. Η Google αντιλαμβάνεται την ύπαρξή της μέσα από links άλλων sites, αλλά επειδή έχει μπλοκαριστεί το crawl, δεν μπορεί να διαβάσει τίτλο, meta description ή περιεχόμενο. Το snippet βγαίνει κενό και το click-through rate καταρρέει.
Για πραγματική αφαίρεση από το index χρειάζεστε noindex με ελεύθερο crawling — ποτέ disallow. Η σωστή απόφαση ανάμεσα στα δύο εργαλεία αναλύεται πλήρως στον οδηγό για το noindex έναντι disallow και τη διαφορά τους στο SEO, που εξηγεί γιατί ο συνδυασμός τους ακυρώνει τον εαυτό του. Παράλληλα, το robots.txt συνεργάζεται με το meta robots tag, που λειτουργεί σε επίπεδο σελίδας και δίνει τις εντολές indexing που το robots.txt δεν μπορεί να δώσει.
Ποια είναι τα πιο μοιραία λάθη στο robots.txt για το SEO;
Το πιο μοιραίο λάθος στο robots.txt είναι ο αποκλεισμός των CSS και JavaScript αρχείων, γιατί εμποδίζει την Google να κάνει render τη σελίδα σωστά και αλλοιώνει την αξιολόγησή της. Ακολουθεί το καθολικό Disallow: / που μπλοκάρει ολόκληρο το site.
Ο αποκλεισμός των resources είναι ύπουλος γιατί δεν φαίνεται αμέσως. Παλιότερα ήταν συνηθισμένο να μπλοκάρονται φάκελοι όπως /wp-includes/ ή /assets/js/. Σήμερα όμως η Google κάνει render τη σελίδα σαν browser, και αν δεν φτάνει στα CSS και JavaScript, βλέπει μια σπασμένη, ημιτελή εκδοχή χωρίς layout και interactivity. Σε sites που στηρίζονται σε client-side rendering, αυτό το λάθος είναι καταστροφικό· οι λεπτομέρειες αναλύονται στον οδηγό για το JavaScript SEO και τον τρόπο που η Google επεξεργάζεται τον κώδικα.
Το δεύτερο μοιραίο λάθος είναι το ξεχασμένο Disallow: /, που συνήθως κληρονομείται από staging περιβάλλον. Όταν ένα site περνά σε production και κανείς δεν αφαιρεί αυτή τη γραμμή, ολόκληρο το domain γίνεται αόρατο στους crawlers. Έχουμε δει e-shops να χάνουν όλη τους την οργανική κίνηση μέσα σε λίγες μέρες εξαιτίας ενός μόνο χαρακτήρα.
Υπάρχουν και λεπτότερα λάθη: case sensitivity, αφού το /Folder/ και το /folder/ θεωρούνται διαφορετικά paths· λανθασμένη χρήση wildcards που μπλοκάρει πολύ περισσότερα URLs από όσα προοριζόταν· και η τοποθέτηση του αρχείου σε subfolder αντί για τη ρίζα, που το καθιστά εντελώς ανενεργό. Κάθε ένα από αυτά απαιτεί έλεγχο πριν το deployment, γιατί το κόστος της διόρθωσης μετά τη ζημιά μετριέται σε εβδομάδες ανάκαμψης.
Πώς συνδέεται το robots.txt με το crawl budget στο SEO;
Το robots.txt προστατεύει το crawl budget κατευθύνοντας τον Googlebot μακριά από άχρηστα URLs, ώστε οι πόροι του crawler να ξοδεύονται στις σημαντικές σελίδες. Σε μεγάλα sites αυτό επιταχύνει την ανακάλυψη νέου περιεχομένου και τη συχνότητα re-crawl.
Το crawl budget είναι ο αριθμός των URLs που η Google είναι διατεθειμένη να κάνει crawl σε ένα site μέσα σε ένα χρονικό διάστημα. Όταν αυτό το budget σπαταλιέται σε faceted navigation, internal search results και άπειρους συνδυασμούς παραμέτρων, οι πραγματικά σημαντικές σελίδες αργούν να ανακαλυφθούν ή να επανεξεταστούν.
Σε μικρά sites το crawl budget σπάνια είναι πρόβλημα, αλλά σε e-shops με δεκάδες χιλιάδες URLs γίνεται κρίσιμο. Ένα στρατηγικό Disallow σε parametrized paths τύπου /*?sort= ή /*?filter= εμποδίζει τη δημιουργία crawl traps και διοχετεύει τους πόρους εκεί που αποδίδουν. Η λεπτομερής διαχείριση αυτής της ισορροπίας περιγράφεται στον οδηγό για το crawl rate limit και τον έλεγχο της συχνότητας crawl.
Προσοχή όμως: το robots.txt δεν είναι η μόνη λύση για το crawl budget. Μπλοκάροντας ένα URL με disallow, δεν εξαφανίζετε τα internal links που οδηγούν σε αυτό· απλώς εμποδίζετε τον crawler να το φορτώσει. Η σωστή αρχιτεκτονική, τα canonical tags και η καθαρή δομή links δουλεύουν μαζί με το robots.txt. Το αρχείο είναι ένα κομμάτι του puzzle, όχι ολόκληρη η λύση, και η αλόγιστη χρήση του δημιουργεί περισσότερα προβλήματα από όσα λύνει.
Πώς δηλώνετε το sitemap μέσα στο robots.txt για το SEO;
Δηλώνετε το sitemap με τη γραμμή Sitemap ακολουθούμενη από το πλήρες απόλυτο URL του αρχείου, τοποθετημένη οπουδήποτε στο robots.txt. Η Sitemap directive είναι ανεξάρτητη από τις ομάδες User-agent και βοηθά κάθε crawler να βρει γρήγορα τη λίστα των URLs σας.
Η σύνταξη είναι απλή: Sitemap: https://domain.gr/sitemap.xml. Σε αντίθεση με τα Disallow και Allow, η γραμμή Sitemap δεν ανήκει σε καμία ομάδα User-agent — ισχύει καθολικά. Μπορείτε να δηλώσετε πολλαπλά sitemaps, καθένα σε δική του γραμμή, κάτι χρήσιμο όταν χωρίζετε το περιεχόμενο σε πολλά αρχεία ή χρησιμοποιείτε sitemap index.
Το URL πρέπει να είναι πάντα απόλυτο, με πλήρες πρωτόκολλο και domain. Ένα σχετικό path όπως /sitemap.xml αγνοείται. Επίσης, το sitemap που δηλώνετε εδώ πρέπει να αντιστοιχεί στο σωστό domain και πρωτόκολλο — ένα http sitemap σε ένα https site δημιουργεί ασυνέπεια που μπερδεύει τον crawler.
Η δήλωση του sitemap στο robots.txt είναι ο πιο αξιόπιστος τρόπος ανακάλυψης, γιατί κάθε bot διαβάζει το αρχείο αυτό πρώτο, ακόμα και χωρίς υποβολή στο Search Console. Ολόκληρη η λογική της δομής και της προτεραιοποίησης των URLs αναλύεται στον οδηγό για τα XML sitemaps και τη σωστή δομή τους, που εξηγεί γιατί ένα καθαρό sitemap πολλαπλασιάζει την αποτελεσματικότητα του robots.txt.
Πώς ελέγχετε αν το robots.txt λειτουργεί σωστά στο SEO;
Ελέγχετε το robots.txt με το robots.txt report του Google Search Console και με το URL Inspection Tool, που δείχνουν αν ένα συγκεκριμένο URL είναι blocked για crawling. Παράλληλα ανοίγετε απευθείας το /robots.txt για να διαβάσετε τους live κανόνες.
Στο Google Search Console, το robots.txt report εμφανίζει την εκδοχή του αρχείου που η Google έχει cache-άρει, μαζί με τυχόν σφάλματα σύνταξης. Το URL Inspection Tool προχωρά ένα βήμα παρακάτω: δοκιμάζετε ένα συγκεκριμένο URL και βλέπετε αν επιτρέπεται ή μπλοκάρεται το crawling, καθώς και ποια γραμμή του αρχείου το μπλοκάρει.
Είναι κρίσιμο να θυμάστε ότι η Google δεν διαβάζει το robots.txt σε κάθε επίσκεψη· το κρατά cache-αρισμένο για περίπου μία μέρα. Έτσι μια αλλαγή που μόλις ανεβάσατε μπορεί να μην ισχύει αμέσως, και αντίστροφα ένα λάθος μπορεί να συνεχίσει να επιδρά για ώρες μετά τη διόρθωση. Όταν ένα λάθος robots.txt μπλοκάρει σελίδες, τα συμπτώματα εμφανίζονται ως crawl errors και προβλήματα indexing στα reports του Search Console, και ο τακτικός έλεγχος εντοπίζει το πρόβλημα πριν εξαπλωθεί.
Πέρα από τα εργαλεία της Google, ο πιο άμεσος έλεγχος είναι να ανοίξετε το /robots.txt του domain σε browser και να διαβάσετε τους κανόνες με τα μάτια σας. Πολλά καταστροφικά λάθη — ένα ξεχασμένο Disallow: /, ένα λάθος path, ένα κενό αρχείο — γίνονται προφανή σε δευτερόλεπτα με αυτή την απλή επιθεώρηση.
Συχνές ερωτήσεις: Robots.txt;
Πού πρέπει να βρίσκεται το αρχείο robots.txt;
Το robots.txt πρέπει να βρίσκεται αποκλειστικά στη ρίζα του domain, στο URL τύπου https://domain.gr/robots.txt. Αν το τοποθετήσετε σε subfolder, οι crawlers δεν θα το αναγνωρίσουν και θα το αγνοήσουν εντελώς. Κάθε subdomain χρειάζεται το δικό του ξεχωριστό αρχείο στη δική του ρίζα.
Μπορεί το robots.txt να κρύψει μια σελίδα από τη Google;
Όχι αξιόπιστα. Το robots.txt εμποδίζει το crawling, όχι το indexing. Μια μπλοκαρισμένη σελίδα με εξωτερικά backlinks μπορεί να εμφανιστεί στα αποτελέσματα χωρίς περιγραφή. Για πραγματική αφαίρεση από το index χρειάζεστε noindex με ελεύθερο crawling, ποτέ disallow.
Τι σημαίνει το Disallow χωρίς τιμή στο robots.txt;
Μια γραμμή Disallow: χωρίς path δεν μπλοκάρει τίποτα — επιτρέπει στην ουσία πλήρη πρόσβαση. Αντίθετα, το Disallow: / με κάθετο μπλοκάρει ολόκληρο το site. Η διαφορά ενός μόνο χαρακτήρα είναι η διαφορά ανάμεσα στην πλήρη πρόσβαση και τον ολικό αποκλεισμό.
Χρειάζεται κάθε site αρχείο robots.txt;
Δεν είναι υποχρεωτικό, αλλά συνιστάται. Αν δεν υπάρχει robots.txt, οι crawlers θεωρούν ότι όλα επιτρέπονται και κάνουν crawl τα πάντα. Ένα καλά δομημένο αρχείο σας δίνει έλεγχο πάνω στο crawling και προστατεύει το crawl budget σε μεγαλύτερα sites.
Πόσο συχνά διαβάζει η Google το robots.txt;
Η Google κρατά cache το robots.txt για περίπου μία μέρα. Αυτό σημαίνει ότι μια αλλαγή δεν εφαρμόζεται αμέσως και ένα λάθος μπορεί να συνεχίσει να επιδρά για ώρες μετά τη διόρθωση. Σε επείγουσες περιπτώσεις, το robots.txt report του Search Console επιταχύνει το re-fetch.
Επηρεάζει το robots.txt το link equity;
Έμμεσα, ναι. Όταν μπλοκάρετε ένα URL με disallow, ο Googlebot δεν διαβάζει τα links της σελίδας, οπότε δεν διοχετεύεται link equity μέσα από αυτήν. Επιπλέον, τα internal links προς μπλοκαρισμένα URLs σπαταλούν ροή αξίας σε σελίδες που η Google δεν θα δει ποτέ.
Συμπέρασμα
Το robots.txt είναι ένα μικρό αρχείο με τεράστια εμβέλεια: ελέγχει το crawling, καθοδηγεί τους crawlers, προστατεύει το crawl budget και δηλώνει το sitemap. Δεν ελέγχει όμως το indexing, και η σύγχυση αυτών των δύο ρόλων είναι η αιτία των περισσότερων καταστροφών — από μπλοκαρισμένα CSS και JavaScript μέχρι ξεχασμένα Disallow: / που εξαφανίζουν ολόκληρα sites.
Ο κανόνας είναι σαφής: χρησιμοποιήστε το robots.txt για να διαχειριστείτε την πρόσβαση των crawlers, όχι για να κρύψετε σελίδες από τα αποτελέσματα. Ελέγχετε κάθε αλλαγή πριν το deployment και επιβεβαιώνετε τη συμπεριφορά μέσα από το Search Console. Η ομάδα της Netstar SEO Agency σχεδιάζει το robots.txt κάθε site ώστε ο Googlebot να ξοδεύει κάθε πόρο του εκεί που πραγματικά μετράει, χωρίς ένα μόνο λάθος να ρισκάρει ολόκληρη την οργανική visibility.
