llms.txt: האם הקובץ הזה באמת מכניס אתכם לתשובות של מנועי AI
מישהו כבר הציע לכם להעלות קובץ llms.txt לשורש האתר, והבטיח שזה מה שיגרום ל-ChatGPT ולג'מיני לצטט אתכם. לפני שאתם מוציאים על זה שעת פיתוח, שווה לדעת מה באמת קורה לקובץ הזה אחרי שהוא עולה. ההפרש בין אתר שמנועי AI מצטטים לאתר שהם מדלגים עליו נמדד בפניות, ולכן כדאי להשקיע את המאמץ במקום שבאמת מזיז את המחט.
התשובה הקצרה: llms.txt לא יזיק לכם, אבל הוא גם לא הכרטיס לתשובה. הדבר שקובע הרבה יותר יושב בקובץ אחר לגמרי, וברוב האתרים שאנחנו נכנסים אליהם הוא מוגדר לא נכון.
מה זה llms.txt ולמה כולם ממהרים להעלות אותו
llms.txt הוא קובץ טקסט פשוט בפורמט Markdown שיושב בשורש הדומיין, בכתובת כמו example.co.il/llms.txt. הרעיון מאחוריו הגיוני: במקום להשאיר למודל שפה לנחש מה חשוב אצלכם, אתם מגישים לו מפה ערוכה. שם העסק, משפט או שניים על מה שאתם עושים, ורשימת קישורים לעמודים המרכזיים עם הסבר קצר לכל אחד.
זה נשמע כמו sitemap.xml של מנועי ה-AI, וזו בדיוק הסיבה שהוא נתפס ככפתור קסם. מעלים קובץ, מסמנים וי, מחכים לציטוטים. הבעיה מתחילה כששואלים מי בצד השני בכלל מבקש אותו.
מה הנתונים מראים על llms.txt בפועל
אף ספק גדול לא התחייב פומבית שהוא משתמש ב-llms.txt כאות בתשובות שהוא מפיק. לא OpenAI, לא אנת'רופיק ולא גוגל. ההנחיות הרשמיות של גוגל לתכונות הגנרטיביות אומרות במפורש שאין צורך בקבצים ייעודיים למכונה כדי להופיע בתשובות, ושמה שנדרש הוא בדיוק מה שנדרש תמיד: עמודים שאפשר לסרוק, תוכן ברור ומבנה תקין.
בדיקות רחבות שנעשו על עשרות אלפי אתרים, וניתוחי לוגים של שרתים בודדים, מצביעים על אותה מסקנה. זחלני ה-AI מושכים את עמודי ה-HTML שוב ושוב, ואת הכתובת /llms.txt הם כמעט לא מבקשים. הם גם לא מחפשים אותה ביוזמתם באתרים שאין בהם קובץ כזה. כשכן מושכים אותו, מי שמושך הוא לרוב כלי פיתוח וסביבות קוד, לא מנוע התשובות שאתם רוצים להיכנס אליו.
המסקנה המעשית פשוטה. עשר דקות עבודה על קובץ llms.txt הן השקעה סבירה אם יש לכם מסמכים או מרכז ידע, אבל אם מוכרים לכם את זה כאסטרטגיית GEO שלמה, קניתם אריזה יפה בלי תוכן. הכוח האמיתי נמצא בקובץ הבא.
הקובץ שכן קובע מי מצטט אתכם
robots.txt הוא השער בפועל. מנועי ה-AI לא מפעילים זחלן אחד אלא כמה, וכל אחד מהם עושה משהו אחר. ההבחנה הזאת היא הנקודה שבה רוב האתרים בישראל טועים, כי מי שהגדיר להם את הקובץ חסם הכול במכה אחת מתוך מחשבה שהוא מגן על התוכן.
ההבדל שחייבים להכיר: זחלן אימון אוסף תוכן כדי לשפר את המודל עצמו, וזחלן תשובות אוסף תוכן כדי להציג ולצטט אותו בתשובה שהמשתמש רואה עכשיו. GPTBot הוא לא OAI-SearchBot. חסימה של הראשון מוציאה אתכם ממאגר האימון ולא פוגעת בנראות. חסימה של השני מוחקת אתכם מהמקורות שהמשתמש רואה מתחת לתשובה, וזה בדיוק הליד שרציתם.

ככה נראית הגדרה שמשאירה את שער התשובות פתוח וסוגרת את שער האיסוף הגורף:
אם אתם דווקא רוצים שגם מאגרי האימון יכירו אתכם, השאירו את GPTBot ואת ClaudeBot פתוחים. זו החלטה עסקית, לא החלטה טכנית, והיא תלויה בשאלה אם התוכן שלכם הוא הנכס שאתם מוכרים או הפרסומת למה שאתם מוכרים. לרוב נותני השירות התשובה היא השנייה.
איך להחליט אילו זחלני AI לפתוח ואילו לחסום
זו ההחלטה בשורה אחת לכל זחלן. עברו על הרשימה עם מי שמתחזק לכם את האתר, ותסיימו את הדיון בעשר דקות.
OAI-SearchBot · לפתוח תמיד
מאנדקס עמודים עבור תוצאות והפניות בתוך ChatGPT. חסימה מוציאה אתכם מרשימת המקורות שמופיעה מתחת לתשובה.
ChatGPT-User · לפתוח תמיד
מושך עמוד בזמן אמת כשמשתמש מבקש לפתוח אותו. חסימה מחזירה למשתמש דף שגיאה במקום התוכן שלכם.
Claude-SearchBot, Claude-User · לפתוח
אחזור ותצוגה של עמודים בתשובות של קלוד. חסימה מוציאה אתכם מהמקורות המצוטטים שם.
GPTBot · החלטה לפי מדיניות התוכן שלכם
אוסף תוכן לאימון המודל. חסימה שלו לא פוגעת בנראות שלכם בתשובות ולא מורידה אתכם מרשימת המקורות.
ClaudeBot · החלטה לפי מדיניות התוכן שלכם
גם הוא זחלן אימון. אותו שיקול בדיוק, ואותה תוצאה: החסימה לא משנה את ההופעה בתשובות.
Google-Extended · להשאיר פתוח ברוב העסקים
שולט בשימוש בתוכן שלכם במוצרי ג'מיני. הוא לא המתג שמוציא אתכם מסקירות ה-AI בתוצאות החיפוש.
CCBot וזחלני איסוף גורפים · לחסום בלי חשש
גריפה רחבה למאגרים ציבוריים. החסימה חוסכת עומס שרת ולא פוגעת בנראות שלכם באף מנוע תשובות.
שורה אחת ברשימה הזאת שווה יותר מכל קובץ llms.txt שתכתבו. רוצים לראות איך זה נראה אצלכם עכשיו? בדקו את הנראות של האתר שלכם במנועי AI ותקבלו תמונה ברורה לפני שאתם נוגעים בהגדרות.
הטעות שמוחקת אתכם מתשובות AI בלי שתשימו לב
הרבה אתרים חוסמים זחלני AI מבלי שאף אחד החליט על זה. זה קורה בשלושה מקומות, וכדאי לבדוק את שלושתם באותו יום:
- שכבת ההגנה של ה-CDN. ספקי CDN גדולים חוסמים היום זחלני AI כברירת מחדל בדומיינים חדשים, ולפעמים גם מוסיפים את החסימה בעדכון מדיניות לחשבונות קיימים. מבחינת האתר הכול תקין, ומבחינת הזחלן התשובה היא דלת סגורה.
- תוסף אבטחה או פיירוול אפליקטיבי. כללי הגנה מפני בוטים חוסמים כל סוכן משתמש שלא מזוהה ברשימה הלבנה שלהם, וזחלני התשובות החדשים לא תמיד נמצאים בה.
- robots.txt שנכתב פעם ונשכח. שורה גורפת שנוספה מתוך זהירות, וכיום היא מוציאה אתכם מכל מנוע תשובות רלוונטי.
הבדיקה המעשית: קחו את לוגי השרת, סננו לפי שם הזחלן, וראו איזה קוד תגובה הוא מקבל. אם הוא מקבל 403 במקום 200, אתם חסומים. אם הוא בכלל לא מופיע בלוג, הוא לא מגיע, וזה כבר עניין של קישורים נכנסים ושל תוכן שאפשר לאחזר.
מה חסימת Google-Extended באמת עושה לסקירות ה-AI
זו אולי אי ההבנה היקרה ביותר בתחום. Google-Extended הוא לא זחלן, אלא מתג הרשאה שמשפיע על השימוש בתוכן שלכם במוצרי ג'מיני. הוא לא קובע אם תופיעו בסקירות ה-AI שמעל תוצאות החיפוש.
סקירות ה-AI הן חלק ממערכת החיפוש, והן ניזונות מהסריקה הרגילה של Googlebot ומהגדרות הסניפט של העמוד. כלומר, כדי לצאת מהן צריך למעשה לפגוע בעצמכם בתוצאות האורגניות, למשל באמצעות הגבלת סניפט או תגית שמונעת הצגת קטעים. לרוב העסקים זו עסקה גרועה, כי אתם מוותרים על חשיפה בשני המקומות בבת אחת.
הכיוון ההפוך משתלם הרבה יותר. במקום לנסות לצאת, כדאי לבנות תוכן שקל לאחזר ולצטט. הרחבנו על זה במדריך על תוכן GEO שמנועי AI יכולים לצטט, והעקרונות שם ישימים גם באתר תדמית קטן.
מתי כן כדאי להעלות llms.txt
יש מקרים שבהם הקובץ מצדיק את עצמו, גם אם הוא לא ישפיע על הדירוג:
- יש לכם תיעוד או מרכז ידע. כלי קוד וסביבות פיתוח כן מושכים llms.txt, ואם אתם מוכרים מוצר טכנולוגי זה חוסך למשתמש חיפוש מייגע.
- האתר גדול ומסועף. רשימה מסודרת של העמודים החשובים היא תרגיל מועיל בפני עצמו, והיא מחדדת לכם מה באמת הליבה.
- אתם רוצים כיסוי לעתיד. אם התקן יאומץ בהמשך, אתם כבר שם. העלות נמוכה.
שני דברים שאסור לעשות עם הקובץ. אל תכניסו לתוכו ניסוח שסותר את מה שכתוב בעמודים עצמם, כי אם מישהו כן יקרא אותו אתם רק יוצרים בלבול. ואל תתנו לו להחליף כותרות תקינות, סכמה, קישורים פנימיים ומהירות טעינה, שהם הדברים שכל מנוע באמת משתמש בהם.
איך לבדוק שזחלני AI באמת מגיעים לאתר
אחרי שתיקנתם את ההרשאות, תרצו לדעת אם זה עבד. ארבע בדיקות שנותנות תשובה:
- לוגי שרת לפי סוכן משתמש. חפשו את OAI-SearchBot, את ChatGPT-User ואת הזחלנים של קלוד, וספרו כמה עמודים הם משכו ואיזה קוד תגובה קיבלו.
- בדיקה חיה. בקשו ממנוע AI לפתוח כתובת ספציפית באתר שלכם ולסכם אותה. אם הוא מחזיר תוכן אמיתי ולא הודעת שגיאה, השער פתוח.
- תנועת הפניה. ההפניות ממנועי AI נבלעות ברוב החשבונות בתוך תנועה ישירה. הסברנו איך להפריד אותן במדריך על מדידת תנועה ממנועי AI.
- בדיקת robots.txt בפועל. אל תסתכלו על הקובץ בעורך, טענו אותו מהדפדפן. בהרבה מערכות התוסף מייצר גרסה אחרת מזו ששמורה אצלכם.
המידע הרשמי של גוגל בנושא מופיע במדריך תכונות ה-AI של Google Search Central, ושם גם מפורטות הגדרות הסניפט שמשפיעות על הצגת התוכן בתשובות.
שאלות נפוצות על llms.txt
האם llms.txt משפיע על הדירוג בגוגל?
לא. גוגל הבהירה שאינה משתמשת בקובץ כאות דירוג, ושאין צורך בקבצים ייעודיים למכונה כדי להופיע בתשובות הגנרטיביות. מה שמשפיע הוא סריקה תקינה, תוכן ברור ועמודים שנותנים תשובה שלמה.
האם llms.txt מחליף את robots.txt?
בשום אופן לא. robots.txt קובע מי רשאי להיכנס, ומנועי ה-AI מכבדים אותו. llms.txt הוא לכל היותר הצעה ידידותית שרובם לא מבקשים. שני קבצים שונים לחלוטין, ורק אחד מהם משנה את המצב שלכם היום.
חסמנו בעבר זחלני AI. כמה זמן לוקח עד שחוזרים להופיע?
ברגע שהחסימה יורדת הזחלן חוזר לסרוק בקצב שלו, ובאתרים פעילים זה נמדד בימים עד שבועות. כדאי לזרז עם תוכן חדש, עם עדכון מפת האתר ועם קישורים נכנסים לעמודים שאתם הכי רוצים לראות מצוטטים.
עדיף לפתוח את כל זחלני ה-AI או לסנן?
לסנן. פותחים את זחלני התשובות כי הם מביאים חשיפה ופניות, וחוסמים את הגורפים שרק אוכלים משאבי שרת. את זחלני האימון מחליטים לפי סוג התוכן: אם הוא הנכס שאתם מוכרים, סגרו.
אם אתם רוצים שמישהו יעבור על ההרשאות, על המבנה ועל התוכן ויסדר את הנראות שלכם במנועי התשובות מקצה לקצה, זה בדיוק מה שאנחנו עושים בשירות קידום במנועי AI. תתחילו מבדיקה, ואחר כך נחליט יחד מה שווה לתקן קודם.

