פתחתם לאחרונה את הלוגים של השרת? ייתכן שנתקלתם בשם ClaudeBot.
זהו הבוט של חברת Anthropic, החברה שמפתחת את מודלי Claude. כמו מערכות AI אחרות, גם Claude צריך לגשת לתוכן באינטרנט כדי ללמוד ולספק תשובות למשתמשים.
המשמעות היא שאתרים רבים נסרקים כיום על ידי בוטים של מערכות AI, בנוסף לבוטים של מנועי חיפוש. אם עוד לא קראתם, כתבתי גם מדריך מקיף לבוטים של OpenAI ומדריך לבוטים של גוגל.
הבוטים של Claude
ל‑Anthropic יש שלושה סוגי בוטים עיקריים.
1. ClaudeBot
User-Agent לדוגמה:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)ClaudeBot הוא הסורק הראשי של Anthropic.
הוא אוסף תוכן ציבורי מהאינטרנט שעשוי לשמש לאימון מודלים עתידיים של Claude.
הסריקה הזו לא אומרת שהתוכן יופיע מיד בתשובות של Claude. מדובר באיסוף נתונים שעשוי לשמש כחלק ממערכי האימון.
2. Claude‑User
User-Agent לדוגמה:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +Claude-User@anthropic.com)Claude‑User אינו crawler רגיל.
זה user‑agent שמופעל כאשר משתמש מבקש מ‑Claude לקרוא עמוד מסוים מהאינטרנט בזמן אמת.
לדוגמה:
- משתמש מבקש מ‑Claude לבדוק מאמר
- Claude פותח את הקישור
- הבקשה מגיעה לשרת עם user‑agent בשם Claude‑User
זו גישה שמופעלת על ידי משתמשים.
3. Claude‑SearchBot
User-Agent לדוגמה:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +Claude-SearchBot@anthropic.com)Claude‑SearchBot משמש לאינדוקס תוכן עבור יכולות חיפוש בתוך מוצרי Claude.
הבוט סורק עמודים כדי לבנות אינדקס שמאפשר למערכת למצוא מידע רלוונטי כאשר משתמשים מבקשים חיפוש.
ההבדל בין הבוטים
שלושת הבוטים פועלים בשכבות שונות:
- ClaudeBot: סריקה ואיסוף תוכן לאימון מודלים
- Claude‑SearchBot: אינדוקס תוכן עבור חיפוש
- Claude‑User: שליפה של עמודים בעקבות בקשה של משתמש
איך לזהות את הבוטים בלוגים
אם יש לכם גישה ללוגים של השרת, כדאי לחפש את המחרוזות:
ClaudeBot
Claude-User
Claude-SearchBotמספר הגרסה עשוי להשתנות. לכן עדיף לחפש לפי שם הבוט בלבד.
בלוגים של אתרים טכניים אפשר למצוא גם user‑agent בשם claude-code, עם מספר גרסה. זו תנועה של Claude Code, כלי הפיתוח של Anthropic, כשהוא מבצע שליפות מהרשת.
ויש מקרה אחד שלא תראו בלוגים בכלל: Claude in Chrome. כשמשתמש מפעיל את Claude בתוך הדפדפן שלו, הבקשות יוצאות מהדפדפן האמיתי של המשתמש, עם user‑agent רגיל של Chrome ומכתובת ה‑IP הביתית שלו. אין שם טוקן של בוט, ו‑robots.txt לא רלוונטי לתנועה כזאת.
robots.txt
ניתן לשלוט בבוטים של Claude דרך robots.txt? מה זה robots.txt? robots.txt הוא קובץ טקסט שיושב בשורש האתר ומגדיר אילו כתובות סורקים רשאים לשלוף. robots.txt שולט בסריקה, לא באינדוקס. להגדרה המלאה של robots.txt .
לדוגמה:
User-agent: ClaudeBot
Disallow: /אפשר גם לחסום רק אזורים מסוימים באתר:
User-agent: ClaudeBot
Disallow: /premium/
Disallow: /members/Anthropic מציינים כי הבוט שלהם מכבד גם את ההנחיה:
Crawl-delayלדוגמה:
User-agent: ClaudeBot
Crawl-delay: 1כך ניתן להאט את קצב הסריקה אם יש עומס על השרת.
אם יש בקובץ קבוצה ספציפית כמו User-agent: ClaudeBot, הבוט מציית רק לה ומתעלם מהכללים שתחת User-agent: *. קבוצה ספציפית וקבוצת כוכבית לא מתמזגות, כך שחסימה שהגדרתם תחת * לא חלה על ClaudeBot ברגע שנתתם לו קבוצה משלו. כל נתיב שרוצים לחסום צריך לחזור גם בקבוצה הספציפית.
טווחי IP
Anthropic מפרסמים רשימת IP רשמית בפורמט JSON:
https://claude.com/crawling/bots.jsonהרשימה כוללת בלוק מרכזי (/22) ועוד קבוצה של כתובות בודדות, והיא מאפשרת לוודא שבקשה שמציגה את עצמה כבוט של Claude באמת מגיעה מהתשתית של Anthropic. אם ה‑IP לא ברשימה, סביר שמישהו מזייף את ה‑user‑agent.
חשוב להפריד בין שני שימושים: הרשימה טובה לאימות, אבל הדרך המומלצת לשליטה בגישה נשארה robots.txt. חסימה לפי IP היא כלי גס יותר, והרשימה עשויה להתעדכן.
שווה גם לדעת מה המחיר של כל חסימה, לפי התיעוד של Anthropic: חסימת ClaudeBot עוצרת רק איסוף לאימון. חסימת Claude‑User מונעת מ‑Claude להביא את העמודים שלכם כשמשתמש מבקש. חסימת Claude‑SearchBot מקטינה את הסיכוי להופיע בתשובות מבוססות חיפוש.
יצירת קשר עם Anthropic
אם אתם מזהים בעיה עם הסורק שלהם, ניתן ליצור קשר עם Anthropic דרך הכתובת:
claudebot@anthropic.comבוטים ישנים של Anthropic
בעבר הופיעו גם user‑agents נוספים:
Claude-Web
Anthropic-AIאלו אינם בשימוש כיום אך עדיין ניתן למצוא אותם בקבצי robots.txt ישנים.
איך לזהות תנועה מ‑Claude באנליטיקס
כאשר Claude פותח עמוד בעקבות בקשה של משתמש, הבקשה תגיע עם user‑agent בשם Claude‑User.
במקרים כאלה ניתן לזהות את התנועה בלוגים של השרת או בכלי אנליטיקס.
robots.txt אינו מנגנון הגנה
robots.txt הוא פרוטוקול מבוסס כבוד.
בוטים גדולים כמו ClaudeBot מכבדים אותו, אך אין מנגנון טכני שמונע מבוטים אחרים להתעלם ממנו.
אם יש תוכן רגיש במיוחד כדאי להשתמש באמצעי הגנה נוספים:
- אימות IP, שאצל Anthropic אפשרי היום מול הרשימה הרשמית ב‑bots.json
- rate limiting
- חסימה ברמת WAF
מה לקחת מפה
- ל‑Anthropic יש שלושה בוטים עיקריים: ClaudeBot, Claude‑SearchBot ו‑Claude‑User
- ClaudeBot סורק אתרים ואוסף תוכן ציבורי לאימון מודלים
- Claude‑SearchBot משמש לאינדוקס תוכן לחיפוש
- Claude‑User ניגש לעמודים כאשר משתמש מבקש מ‑Claude לקרוא אותם
- ניתן לשלוט בגישה דרך robots.txt
אם אתם רוצים להבין איך מערכות AI משתמשות בתוכן שלכם באינטרנט, מעקב אחרי הבוטים האלו בלוגים הוא מקום מצוין להתחיל.
אם אתם רוצים להשפיע על מה שמערכות AI אומרות עליכם ולא רק לצפות מהצד, זה בדיוק מה שאני עושה כמומחה GEO.



