דילוג לתוכן
פינג

מחולל ובודק robots.txt

בוחרים מה מותר ומה חסום, כולל בוטים של בינה מלאכותית, ומקבלים קובץ robots.txt מוכן. בלשונית "בדיקת כתובות" מדביקים קובץ קיים או טוענים אותו מאתר, ורואים אם כתובת מסוימת חסומה לגוגל או לבוט אחר, ואיזה כלל קבע את זה.

נתיב מתחיל ב־/. אפשר להשתמש ב־* ובסימן $ לסוף כתובת.

בוטים של בינה מלאכותית

robots.txt

User-agent: *
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
Disallow: /

שמרו בשורש האתר, כך שהקובץ ייפתח בכתובת ‎/robots.txt.

רץ בדפדפן שלכם. המחולל והבודק רצים בדפדפן. רק טעינת robots.txt מאתר עוברת דרך השרת שלנו, שמוריד את הקובץ בלי לשמור אותו.

איך זה עובד

  1. בוחרים הגדרות

    מה לחסום, אילו בוטים לחסום או לאשר, ואיפה מפת האתר.

  2. מעתיקים או מורידים

    שומרים כקובץ robots.txt בתיקייה הראשית של האתר.

  3. בודקים כתובות

    בלשונית "בדיקת כתובות" רואים אם כתובת מותרת, לאיזה בוט ולמה.

מה robots.txt עושה, ומה לא

robots.txt הוא קובץ טקסט בשורש האתר שאומר לזחלנים (בוטים של מנועי חיפוש ושל שירותים אחרים) אילו כתובות לא לסרוק. בוטים מכובדים מצייתים לו, אבל זו בקשה ולא מנעול: הוא לא מגן על מידע רגיש.

חסימה ב־robots.txt גם לא מוציאה דף מגוגל. אם יש אליו קישורים, הוא יכול להופיע בתוצאות בלי תיאור. כדי להוציא דף מהאינדקס משתמשים ב־noindex, ומשאירים אותו פתוח לסריקה כדי שגוגל יראה את התגית.

מקורות: RFC 9309: Robots Exclusion Protocol · Google: מבוא ל־robots.txt

איך גוגל בוחר איזה כלל חל

  • כל בוט מציית רק לקבוצה אחת: זו עם שם הבוט המדויק ביותר (למשל Googlebot), ואם אין כזו, לקבוצה של *.
  • בתוך הקבוצה מנצח הכלל עם הנתיב הארוך ביותר שמתאים לכתובת. בתיקו, Allow גובר על Disallow.
  • * מתאים לכל רצף תווים, ו־$ בסוף מסמן את סוף הכתובת. נתיבים רגישים לאותיות גדולות וקטנות.
  • גוגל קורא רק את 500 הקילובייט הראשונים של הקובץ.

מקורות: Google: איך גוגל מפרש robots.txt

בוטים של בינה מלאכותית

אפשר לחסום בוטים של אימון ועדיין לאפשר בוטים של חיפוש, כך שהאתר ימשיך להופיע כמקור בתשובות של עוזרי AI.

בוטים נפוצים של AI ומה הם עושים
בוטחברהשימוש
GPTBotOpenAIאיסוף תוכן לאימון מודלים
OAI-SearchBotOpenAIהופעה בתוצאות החיפוש של ChatGPT
ClaudeBotAnthropicאיסוף תוכן לאימון מודלים
Claude-SearchBotAnthropicהופעה בתוצאות החיפוש של Claude
Google-ExtendedGoogleשימוש בתוכן לאימון Gemini. לא משפיע על החיפוש בגוגל
PerplexityBotPerplexityהופעה בתוצאות של Perplexity
CCBotCommon Crawlארכיון פתוח שמשמש לאימון מודלים רבים

מקורות: OpenAI: הבוטים של OpenAI · Google: זחלנים נפוצים · Anthropic: זחלנים

שאלות נפוצות

איפה שמים את קובץ robots.txt?

בשורש הדומיין, בכתובת https://example.co.il/robots.txt בדיוק. קובץ בתיקייה אחרת לא נקרא. לכל תת־דומיין צריך קובץ משלו.

Disallow מוציא דף מגוגל?

לא. Disallow רק מבקש לא לסרוק את הדף. כדי להוציא דף מהתוצאות, השאירו אותו פתוח לסריקה והוסיפו לו meta robots עם noindex.

איך חוסמים את ChatGPT מלאסוף תוכן מהאתר?

מוסיפים קבוצה עם User-agent: GPTBot ו־Disallow: /. במחולל מסמנים "חסימת בוטים של אימון AI", והקבוצות לבוטים הנפוצים נוצרות אוטומטית.

מה זה Crawl-delay?

בקשה להשהות בין סריקות. בינג ו־Yandex מתחשבים בה, אבל גוגל מתעלם ממנה. לגוגל קצב הסריקה נקבע אוטומטית.

חייבים robots.txt?

לא. בלי הקובץ, בוטים מניחים שמותר לסרוק הכול. הוא שימושי כשיש אזורים שלא כדאי לסרוק, כמו חיפוש פנימי או עגלת קניות, וכדי להצביע על מפת האתר.

עוד כלים חינמיים בעברית, מאותה משפחה