robots.txt
Robots.txt הוא קובץ טקסט פשוט שממוקם בשרת של אתר אינטרנט ומשמש להנחיית מנועי החיפוש כיצד לסרוק ולהציג את האתר בתוצאות החיפוש. הקובץ מכתיב אילו דפים או חלקים באתר זמינים לסריקה (crawl) ואילו לא, ובכך מאפשר למנהלי אתרים לשלוט על הנראות והחשיפה של תכנים מסוימים. קובץ robots.txt הוצג לראשונה בשנת 1994 כחלק מפרוטוקול ה-Robots Exclusion Protocol,
Robots.txt הוא קובץ טקסט פשוט שממוקם בשרת של אתר אינטרנט ומשמש להנחיית מנועי החיפוש כיצד לסרוק ולהציג את האתר בתוצאות החיפוש. הקובץ מכתיב אילו דפים או חלקים באתר זמינים לסריקה (crawl) ואילו לא, ובכך מאפשר למנהלי אתרים לשלוט על הנראות והחשיפה של תכנים מסוימים.
קובץ robots.txt הוצג לראשונה בשנת 1994 כחלק מפרוטוקול ה-Robots Exclusion Protocol, במטרה להתמודד עם הבעיה של סורקי רשת (web crawlers) שגרמו לעומס על שרתים או ניגשו לתכנים רגישים.
| בתחילת הדרך היו מקרים בהם מנהלי אתרים הגדירו בטעות הגבלות שגרמו להיעלמות האתר כולו מתוצאות החיפוש, רק בגלל שורה אחת שגויה בקובץ. מאז, קובץ זה הפך לכלי קריטי בתהליך של בניית אתרים ו-קידום אורגני בגוגל, במיוחד בניהול דפים שלא אמורים להיות ציבוריים, כמו עמודי בדיקה או תוכן משוכפל. |
שאלות נפוצות על robots.txt
קובץ robots.txt הוא קובץ טקסט הממוקם בתיקיית השורש של האתר ומורה לרובוטים של מנועי חיפוש אילו דפים או תיקיות מותר או אסור לסרוק. חשוב לזכור שמדובר בהנחיה מבוססת אמון ולא במנגנון אבטחה, ורובוטים זדוניים יכולים להתעלם ממנה.
לא בהכרח. חסימת סריקה ב-robots.txt מונעת מגוגל לקרוא את תוכן הדף, אבל אם דפים אחרים מקשרים אליו הוא עדיין עלול להופיע בתוצאות החיפוש ללא תיאור מלא. כדי למנוע הופעה בתוצאות החיפוש צריך להשתמש בתגית meta robots עם noindex, ולא בחסימת סריקה בלבד.
הקובץ חייב להיות ממוקם בנתיב הראשי של הדומיין, למשל example.com/robots.txt, אחרת מנועי החיפוש לא יזהו אותו. ניתן לבדוק את תקינות הקובץ ואת השפעתו על סריקת האתר באמצעות דוחות הסריקה ב-Google Search Console.






















