4 דקות קריאה

הבוטים של קלוד (Claude): מי סורק את האתר שלכם, למה, ומה לעשות עם זה

מדריך מלא לבוטים של קלוד (Anthropic) - ClaudeBot, Claude-User ו-Claude-SearchBot. מה כל אחד עושה, איך לזהות אותם בלוגים, מתי לחסום ומתי לתת להם להיכנס.

פתחתם לאחרונה את הלוגים של השרת? ייתכן שנתקלתם בשם ClaudeBot.

זהו הבוט של חברת Anthropic, החברה שמפתחת את מודלי Claude. כמו מערכות AI אחרות, גם Claude צריך לגשת לתוכן באינטרנט כדי ללמוד ולספק תשובות למשתמשים.

המשמעות היא שאתרים רבים נסרקים כיום על ידי בוטים של מערכות AI, בנוסף לבוטים של מנועי חיפוש. אם עוד לא קראתם, כתבתי גם מדריך מקיף לבוטים של OpenAI ומדריך לבוטים של גוגל.

הבוטים של Claude

ל‑Anthropic יש שלושה סוגי בוטים עיקריים.

1. ClaudeBot

User-Agent לדוגמה:

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)

ClaudeBot הוא הסורק הראשי של Anthropic.

הוא אוסף תוכן ציבורי מהאינטרנט שעשוי לשמש לאימון מודלים עתידיים של Claude.

הסריקה הזו לא אומרת שהתוכן יופיע מיד בתשובות של Claude. מדובר באיסוף נתונים שעשוי לשמש כחלק ממערכי האימון.

2. Claude‑User

User-Agent לדוגמה:

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +Claude-User@anthropic.com)

Claude‑User אינו crawler רגיל.

זה user‑agent שמופעל כאשר משתמש מבקש מ‑Claude לקרוא עמוד מסוים מהאינטרנט בזמן אמת.

לדוגמה:

  • משתמש מבקש מ‑Claude לבדוק מאמר
  • Claude פותח את הקישור
  • הבקשה מגיעה לשרת עם user‑agent בשם Claude‑User

זו גישה שמופעלת על ידי משתמשים.

3. Claude‑SearchBot

User-Agent לדוגמה:

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +Claude-SearchBot@anthropic.com)

Claude‑SearchBot משמש לאינדוקס תוכן עבור יכולות חיפוש בתוך מוצרי Claude.

הבוט סורק עמודים כדי לבנות אינדקס שמאפשר למערכת למצוא מידע רלוונטי כאשר משתמשים מבקשים חיפוש.

ההבדל בין הבוטים

שלושת הבוטים פועלים בשכבות שונות:

  • ClaudeBot: סריקה ואיסוף תוכן לאימון מודלים
  • Claude‑SearchBot: אינדוקס תוכן עבור חיפוש
  • Claude‑User: שליפה של עמודים בעקבות בקשה של משתמש

איך לזהות את הבוטים בלוגים

אם יש לכם גישה ללוגים של השרת, כדאי לחפש את המחרוזות:

ClaudeBot
Claude-User
Claude-SearchBot

מספר הגרסה עשוי להשתנות. לכן עדיף לחפש לפי שם הבוט בלבד.

בלוגים של אתרים טכניים אפשר למצוא גם user‑agent בשם claude-code, עם מספר גרסה. זו תנועה של Claude Code, כלי הפיתוח של Anthropic, כשהוא מבצע שליפות מהרשת.

ויש מקרה אחד שלא תראו בלוגים בכלל: Claude in Chrome. כשמשתמש מפעיל את Claude בתוך הדפדפן שלו, הבקשות יוצאות מהדפדפן האמיתי של המשתמש, עם user‑agent רגיל של Chrome ומכתובת ה‑IP הביתית שלו. אין שם טוקן של בוט, ו‑robots.txt לא רלוונטי לתנועה כזאת.

robots.txt

ניתן לשלוט בבוטים של Claude דרך robots.txt מה זה robots.txt? robots.txt הוא קובץ טקסט שיושב בשורש האתר ומגדיר אילו כתובות סורקים רשאים לשלוף. robots.txt שולט בסריקה, לא באינדוקס. להגדרה המלאה של robots.txt .

לדוגמה:

User-agent: ClaudeBot
Disallow: /

אפשר גם לחסום רק אזורים מסוימים באתר:

User-agent: ClaudeBot
Disallow: /premium/
Disallow: /members/

Anthropic מציינים כי הבוט שלהם מכבד גם את ההנחיה:

Crawl-delay

לדוגמה:

User-agent: ClaudeBot
Crawl-delay: 1

כך ניתן להאט את קצב הסריקה אם יש עומס על השרת.

אם יש בקובץ קבוצה ספציפית כמו User-agent: ClaudeBot, הבוט מציית רק לה ומתעלם מהכללים שתחת User-agent: *. קבוצה ספציפית וקבוצת כוכבית לא מתמזגות, כך שחסימה שהגדרתם תחת * לא חלה על ClaudeBot ברגע שנתתם לו קבוצה משלו. כל נתיב שרוצים לחסום צריך לחזור גם בקבוצה הספציפית.

טווחי IP

Anthropic מפרסמים רשימת IP רשמית בפורמט JSON:

https://claude.com/crawling/bots.json

הרשימה כוללת בלוק מרכזי (/22) ועוד קבוצה של כתובות בודדות, והיא מאפשרת לוודא שבקשה שמציגה את עצמה כבוט של Claude באמת מגיעה מהתשתית של Anthropic. אם ה‑IP לא ברשימה, סביר שמישהו מזייף את ה‑user‑agent.

חשוב להפריד בין שני שימושים: הרשימה טובה לאימות, אבל הדרך המומלצת לשליטה בגישה נשארה robots.txt. חסימה לפי IP היא כלי גס יותר, והרשימה עשויה להתעדכן.

שווה גם לדעת מה המחיר של כל חסימה, לפי התיעוד של Anthropic: חסימת ClaudeBot עוצרת רק איסוף לאימון. חסימת Claude‑User מונעת מ‑Claude להביא את העמודים שלכם כשמשתמש מבקש. חסימת Claude‑SearchBot מקטינה את הסיכוי להופיע בתשובות מבוססות חיפוש.

יצירת קשר עם Anthropic

אם אתם מזהים בעיה עם הסורק שלהם, ניתן ליצור קשר עם Anthropic דרך הכתובת:

claudebot@anthropic.com

בוטים ישנים של Anthropic

בעבר הופיעו גם user‑agents נוספים:

Claude-Web
Anthropic-AI

אלו אינם בשימוש כיום אך עדיין ניתן למצוא אותם בקבצי robots.txt ישנים.

איך לזהות תנועה מ‑Claude באנליטיקס

כאשר Claude פותח עמוד בעקבות בקשה של משתמש, הבקשה תגיע עם user‑agent בשם Claude‑User.

במקרים כאלה ניתן לזהות את התנועה בלוגים של השרת או בכלי אנליטיקס.

robots.txt אינו מנגנון הגנה

robots.txt הוא פרוטוקול מבוסס כבוד.

בוטים גדולים כמו ClaudeBot מכבדים אותו, אך אין מנגנון טכני שמונע מבוטים אחרים להתעלם ממנו.

אם יש תוכן רגיש במיוחד כדאי להשתמש באמצעי הגנה נוספים:

  • אימות IP, שאצל Anthropic אפשרי היום מול הרשימה הרשמית ב‑bots.json
  • rate limiting
  • חסימה ברמת WAF

מה לקחת מפה

  1. ל‑Anthropic יש שלושה בוטים עיקריים: ClaudeBot, Claude‑SearchBot ו‑Claude‑User
  2. ClaudeBot סורק אתרים ואוסף תוכן ציבורי לאימון מודלים
  3. Claude‑SearchBot משמש לאינדוקס תוכן לחיפוש
  4. Claude‑User ניגש לעמודים כאשר משתמש מבקש מ‑Claude לקרוא אותם
  5. ניתן לשלוט בגישה דרך robots.txt

אם אתם רוצים להבין איך מערכות AI משתמשות בתוכן שלכם באינטרנט, מעקב אחרי הבוטים האלו בלוגים הוא מקום מצוין להתחיל.

אם אתם רוצים להשפיע על מה שמערכות AI אומרות עליכם ולא רק לצפות מהצד, זה בדיוק מה שאני עושה כמומחה GEO.

שאלות נפוצות

מה זה ClaudeBot?

ClaudeBot הוא הסורק הרשמי של Anthropic. הוא אוסף תוכן ציבורי מהאינטרנט שעשוי לשמש לאימון מודלים עתידיים של Claude.

מה זה Claude-User?

Claude-User הוא user-agent שמופעל כאשר משתמש מבקש מ-Claude לקרוא עמוד מסוים בזמן אמת.

מה זה Claude-SearchBot?

Claude-SearchBot משמש לאינדוקס תוכן עבור יכולות חיפוש במוצרים של Claude.

האם Claude מכבד robots.txt?

כן. הבוטים של Anthropic מכבדים robots.txt וניתן לחסום כל אחד מהם בנפרד.

האם Anthropic מפרסמים טווחי IP רשמיים?

כן. Anthropic מפרסמים רשימת IP רשמית בכתובת claude.com/crawling/bots.json. אם בקשה עם user-agent של Claude מגיעה מכתובת שלא נמצאת ברשימה, סביר שמדובר בזיוף.

אהבתם את התוכן? הוסיפו אותי כמקור מועדף בגוגלאהבתם את התוכן? הוסיפו אותי כמקור מועדף בגוגל
שיתוףXLinkedInהעתקת קישור