9 דקות קריאה

הבוטים של גוגל: מי סורק בשביל החיפוש ומי בשביל ה-AI

מדריך לכל הבוטים של גוגל: Googlebot, Google-Extended, GoogleOther, Google-Agent ו-Google-GeminiNotebook. מה כל אחד עושה, מי מהם מזין את החיפוש ומי את ה-AI, איך לזהות אותם בלוגים ומה כל טוקן שולט עליו.

בלוגים של אתר גדול תמצאו הרבה יותר מ-Googlebot אחד. יש שם GoogleOther, יש Google-InspectionTool, ולאחרונה גם Google-Agent ו-Google-GeminiNotebook.

חלק מהשמות האלה מזינים את החיפוש, חלק מזינים את Gemini, וחלק לא מזינים כלום ומשמשים ככלי בדיקה.

פתחתי את הלוגים של כמה אתרים גדולים כדי לראות מי מהשמות האלה באמת מופיע. חלק מגיעים כל יום, וחלק לא ראיתי אף פעם. ולשניים מהטוקנים שמופיעים בתיעוד אין בכלל user agent, כך שהם לא יופיעו בלוגים לעולם.

כתבתי בעבר גם על הבוטים של OpenAI ועל הבוטים של Anthropic. אצל גוגל הרשימה ארוכה יותר, והחלוקה בין הבוטים פחות אינטואיטיבית.

שלוש הקטגוריות של סורקי גוגל

לכל קטגוריה התנהגות שונה מול robots.txt, וזה ההבדל המעשי ביניהן.

Common crawlers

הסורקים הרגילים. התיעוד אומר עליהם שהם תמיד מצייתים ל-robots.txt בסריקה אוטומטית. כאן יושבים Googlebot וכל הווריאציות שלו, וגם GoogleOther ו-Google-CloudVertexBot.

Special-case crawlers

סורקים של מוצרים ספציפיים, בעיקר פרסום. הם עשויים להתעלם מ-robots.txt, והם מגיעים מטווחי IP נפרדים.

User-triggered fetchers

פעולות שמשתמש יזם. התיעוד אומר שהם בדרך כלל מתעלמים מ-robots.txt, בדיוק בגלל שהמשתמש ביקש אותן.

הבוטים של גוגל שמזינים את החיפוש, כולל AI Overviews

טוקן הוא השם שכותבים בשורת User-agent ב-robots.txt כדי לפנות לבוט מסוים. הוא לא זהה למחרוזת ה-user agent המלאה שמופיעה בלוגים, שארוכה בהרבה, ויש טוקנים שאין להם מחרוזת משלהם בכלל.

טוקןמה הוא מזין
Googlebotהחיפוש, כולל Discover וכל תכונות החיפוש
Googlebot-Imageתמונות, Discover, וכל מקום שמוצגות בו תמונות ולוגואים
Googlebot-Videoתכונות וידאו בחיפוש
Googlebot-NewsGoogle News ואפליקציית החדשות
Storebot-GoogleGoogle Shopping על כל המשטחים שלו

ה-user agent של Googlebot, בגרסת המובייל ובגרסת הדסקטופ:

Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36

Googlebot-Image ו-Googlebot-Video מגיעים עם מחרוזות קצרות משלהם, Googlebot-Image/1.0 ו-Googlebot-Video/1.0.

Googlebot-News הוא טוקן בקרה בלבד. אין לו user agent משלו, והסריקה מתבצעת עם המחרוזות הרגילות של Googlebot.

באותה קטגוריה יושב גם Google-InspectionTool, שלא סורק תוכן לחיפוש אלא משרת את כלי הבדיקה של Search Console. התיעוד אומר עליו שאין לו שום השפעה על החיפוש.

AI Overviews ו-AI Mode מוזנים על ידי Googlebot. אין להם טוקן נפרד. גוגל כותבת בתיעוד שה-AI בנוי בתוך החיפוש, ושההוראות ב-robots.txt עבור Googlebot הן הבקרה על האופן שבו האתר נסרק עבור החיפוש.

הטוקנים של גוגל ל-AI: Google-Extended הוא לא סורק

Google-Extended

Google-Extended הוא לא סורק.

התיעוד אומר במפורש שאין לו user agent משלו, ושהסריקה מתבצעת עם ה-user agents הרגילים של גוגל בעוד הטוקן משמש בתפקיד של בקרה. בעמוד התיעוד, במקום שבו לכל בוט אחר מופיעה מחרוזת, אצלו פשוט כתוב שאין. כלומר הוא לא ייצור אף בקשה בלוגים שלכם, ולא ישנה את עומס הסריקה. הוא קובע מה מותר לגוגל לעשות עם תוכן שהיא כבר שלפה.

לפי ההגדרה הוא מכסה שני דברים: אימון של דורות עתידיים של מודלי Gemini שמפעילים את Gemini Apps ואת Vertex AI API, וביסוס תשובות, כלומר הזנת תוכן מהאינדקס של החיפוש למודל בזמן הפרומפט, ב-Gemini Apps וב-Grounding with Google Search on Vertex AI.

התיעוד ממשיך ואומר ש-Google-Extended לא משפיע על הכללת האתר בחיפוש ולא משמש כסיגנל דירוג.

המשמעות המעשית: חסימת Google-Extended לא מוציאה אתכם מ-AI Overviews ומ-AI Mode. בעמוד נפרד גוגל כותבת שה-AI בנוי בתוך החיפוש, ושההוראות ב-robots.txt עבור Googlebot הן הבקרה עליו, ומפנה את Google-Extended למערכות אחרות שלה.

GoogleOther

GoogleOther הוא סורק גנרי. התיעוד מגדיר אותו כמי שלא משויך לשום מוצר ספציפי, ואומר שצוותים שונים בגוגל עשויים להשתמש בו כדי לשלוף תוכן ציבורי, למשל לסריקות חד פעמיות למחקר ופיתוח פנימי.

ה-user agent שלו:

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GoogleOther) Chrome/W.X.Y.Z Safari/537.36

יש לו שתי וריאציות, GoogleOther-Image ו-GoogleOther-Video, שמגיעות כ-GoogleOther-Image/1.0 ו-GoogleOther-Video/1.0, ושתיהן מכבדות גם את הטוקן GoogleOther.

מקובל לתאר אותו כסורק ה-AI של גוגל. חיפשתי בהגדרה הרשמית שלו את המילים AI, Gemini ואימון, ואף אחת מהן לא שם.

זה לא אומר שהתיעוד שולל את זה. ״צוותים שונים״ ו״מחקר ופיתוח פנימי״ זו הגדרה שמכסה כמעט הכל. מה שאפשר לומר בביטחון: אין מסמך של גוגל שקושר את GoogleOther לאימון Gemini. אם יתפרסם עדכון תיעוד שנוקב בשם מוצר, זה ישתנה.

Google-CloudVertexBot

Google-CloudVertexBot הוא סורק אמיתי, עם user agent, שמופיע בלוגים. התיעוד מגדיר אותו כמי שמשרת סריקות שבעלי אתרים עצמם ביקשו לצורך בניית Vertex AI Agents, ואומר שאין לו השפעה על החיפוש.

התיעוד לא מפרסם עבורו מחרוזת מלאה אלא רק את הרצף Google-CloudVertexBot בתוך ה-user agent, וזה מה שכדאי לחפש בלוגים.

הוא נופל חזרה גם על הטוקן Googlebot, כך שאתר שחוסם את Googlebot כבר חוסם גם אותו.

פעולות משתמש: Google-Agent ו-Google-GeminiNotebook

Google-Agent

Google-Agent הוא הסוכן שגולש באתרים ומבצע פעולות לפי בקשת משתמש. הוא רץ על תשתית של גוגל, ויש לו רשימת IP נפרדת משלו, user-triggered-agents.json, וה-reverse DNS שלו הוא google-proxy-***.google.com.

ה-user agent שלו בדסקטופ:

Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko; compatible; Google-Agent; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-agent) Chrome/W.X.Y.Z Safari/537.36

גוגל מנסה עליו את פרוטוקול web-bot-auth עם הזהות agent.bot.goog, וחותמת חלק מהבקשות בחתימה קריפטוגרפית. החתימה מאפשרת לוודא שהבקשה באמת הגיעה מגוגל, והיא עדיין ניסיונית.

Google-GeminiNotebook

Google-GeminiNotebook שולף כתובות שמשתמשי Gemini Notebook הוסיפו כמקורות לפרויקט שלהם. בניגוד ל-Google-Agent, הוא מגיע מקובצי ה-fetchers ולא מקובץ הסוכנים, וה-reverse DNS שלו מסתיים ב-gae.googleusercontent.com.

ה-user agent שלו בדסקטופ:

Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/137.0.0.0 Safari/537.36 (compatible; Google-GeminiNotebook; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-gemininotebook)

השם הזה חדש. עד יולי 2026 הוא נקרא Google-NotebookLM, והשם הישן מסומן בתיעוד כנתמך עד אוגוסט 2026 בלבד. אם המחרוזת הישנה מקודדת אצלכם בחומת אש או בפרסר לוגים, כדאי להחליף אותה עכשיו. הכשל כאן שקט: התנועה ממשיכה להגיע, רק הכלל מפסיק לזהות אותה.

השאר

באותה קטגוריה יושבים גם FeedFetcher-Google לפידים של RSS ו-WebSub, Google-Read-Aloud להקראת עמודים, Google-Site-Verification לאימות ב-Search Console, GoogleMessages לתצוגה מקדימה של קישורים בצ׳אט, Google-Pinpoint לאוספי מסמכים אישיים ב-Pinpoint, ו-Google-CWS לחנות התוספים של Chrome.

סורקי הפרסום של גוגל, ו-Google-Safety

AdsBot-Google ו-AdsBot-Google-Mobile בודקים את איכות העמודים שאליהם מובילות מודעות. Mediapartners-Google הוא הסורק של AdSense. APIs-Google קשור למשלוח הודעות push.

לארבעתם יש התנהגות משותפת: התיעוד אומר שהם מצייתים לטוקן שלהם, אבל שהטוקן הגלובלי של הכוכבית לא נלקח בחשבון. כלומר User-agent: * עם Disallow: / לא נוגע בהם. צריך קבוצה מפורשת בשמם.

Google-Safety, שמטפל בסריקות אבטחה כמו איתור נוזקות, מתעלם מ-robots.txt לגמרי.

robots.txt: מה כל טוקן חוסם

אפשר לשלוט בכל טוקן בנפרד:

User-agent: Google-Extended
Disallow: /

User-agent: GoogleOther
Disallow: /

שווה לדעת מה המחיר של כל חסימה:

אם תחסמו אתזה מה שיקרה
Googlebotגוגל תפסיק לסרוק, ובפועל תאבדו את הנראות בחיפוש. גוגל לא תראה יותר את התוכן בדפים, ורובם ייצאו מהתוצאות עם הזמן. טכנית זו לא הוצאה מהאינדקס: כתובת עם קישורים חיצוניים חזקים יכולה להישאר בתוצאות בלי תיאור, וזה החריג ולא הכלל. גם AI Overviews ו-AI Mode ייעלמו, כי הם רצים על אותו סורק
Google-Extendedגוגל לא תשתמש בתוכן לאימון של דורות עתידיים של Gemini, ולא תבסס עליו תשובות ב-Gemini Apps וב-Vertex. מה שכבר אומן לא מתבטל. לפי התיעוד הדירוג בחיפוש לא ייפגע
GoogleOtherצוותים בגוגל לא יוכלו לשלוף את התוכן לסריקות גנריות שלא משויכות למוצר
Google-CloudVertexBotלקוחות Vertex AI לא יוכלו לבנות agent שמסתמך על התוכן שלכם
Google-InspectionToolכלי הבדיקה שלכם ב-Search Console יפסיקו להחזיר תוצאות. שום השפעה אחרת

לגבי הקטגוריה של פעולות משתמש, כלומר Google-Agent ו-Google-GeminiNotebook: התיעוד אומר שהיא בדרך כלל מתעלמת מ-robots.txt, ולא מציג את הטוקנים האלה ככלי חסימה.

כלל שחל על כל הבוטים: ברגע שקיימת בקובץ קבוצה ספציפית, למשל User-agent: Googlebot, הבוט מציית רק לה ומתעלם מהכללים שתחת User-agent: *. קבוצה ספציפית וקבוצת כוכבית לא מתמזגות, כך שכל נתיב שרוצים לחסום צריך לחזור גם בקבוצה הספציפית.

איך לזהות את הבוטים של גוגל בלוגים

כדאי לחפש את שמות הטוקנים. מספרי הגרסה משתנים, אז עדיף לחפש לפי השם בלבד:

Googlebot
GoogleOther
Google-InspectionTool
Google-CloudVertexBot
Google-Agent
Google-GeminiNotebook

Google-InspectionTool מגיע מבדיקות שאתם עצמכם מריצים ב-Search Console, ולכן הוא מופיע בלוגים בפרצים ולא ברצף.

איך לאמת בוט של גוגל מול טווחי IP

user agent הוא מחרוזת טקסט. כל אחד יכול לשלוח בקשה שכתוב בה Googlebot.

גוגל מפרסמת חמישה קבצי JSON עם טווחי ה-IP, ואפשר לאמת מולם כל בקשה. יש לי רשימה מלאה שמתעדכנת מדי יום עם כל הטווחים והוראות אימות ב-iptables וב-Nginx.

reverse DNS של סורק רגיל מסתיים ב-googlebot.com, ואת התוצאה כדאי להצליב מול טווחי ה-CIDR של הקובץ המתאים.

מה לקחת מפה

  1. לגוגל שלוש קטגוריות של סורקים, והן נבדלות בעיקר בהתנהגות מול robots.txt.
  2. AI Overviews ו-AI Mode רצים על Googlebot. אין להם טוקן משלהם.
  3. Google-Extended הוא טוקן הרשאה ולא סורק, והוא נוגע ל-Gemini ול-Vertex.
  4. GoogleOther מוגדר בתיעוד כסורק גנרי. אין מסמך שקושר אותו לאימון Gemini, וגם לא כזה ששולל את זה.
  5. Google-NotebookLM הפך ל-Google-GeminiNotebook, והשם הישן נתמך עד אוגוסט 2026.
  6. סורקי הפרסום מתעלמים מהכוכבית ודורשים קבוצה בשמם.
  7. user agent לבדו לא מאמת כלום. תמיד מול ה-IP.
אהבתם את התוכן? הוסיפו אותי כמקור מועדף בגוגלאהבתם את התוכן? הוסיפו אותי כמקור מועדף בגוגל
שיתוףXLinkedInהעתקת קישור