כשעסק רוצה ש-AI יענה על שאלות מתוך הידע שלו — המחירון, הנהלים, מפרטי המוצרים — עולה מיד השאלה "איך מלמדים את המודל את המידע שלנו?". התשובה המפתיעה היא שברוב המקרים לא מלמדים אותו בכלל. נותנים לו את המידע ברגע השאלה.
השיטה הזו נקראת RAG, ראשי תיבות של Retrieval-Augmented Generation — יצירה שנתמכת באחזור. היא הפכה לתשתית הסטנדרטית של כמעט כל פרויקט AI עסקי רציני, ובמאמר הזה אסביר איך היא עובדת, למה היא עדיפה על החלופות, ואיפה היא נכשלת בפועל.
הבעיה שRAG פותרת
מודל שפה מאומן על כמות עצומה של טקסט ציבורי. הוא לא מכיר את המחירון שלכם, את מדיניות הביטולים שלכם, או את מה שסוכם עם לקוח מסוים בשנה שעברה.
כששואלים אותו בכל זאת, הוא לא אומר "אינני יודע" — הוא מייצר את התשובה הסבירה ביותר. מדיניות החזרות שנשמעת הגיונית, מחיר שנשמע סביר. התשובה תקינה לשונית ומשכנעת לחלוטין, והיא פשוט לא נכונה.
זו לא תקלה שאפשר לתקן בניסוח טוב יותר של השאלה. זו תכונה של איך מודלים עובדים, ולכן הפתרון חייב להיות ארכיטקטוני.
איך RAG עובד — בשלושה שלבים
שלב 1: הכנה (קורה פעם אחת, ומתעדכן). המסמכים של העסק נשברים לקטעים, וכל קטע עובר המרה לייצוג מספרי שמייצג את המשמעות שלו. הייצוגים נשמרים במסד נתונים ייעודי. זה מה שמאפשר לחפש לפי משמעות ולא לפי מילים מדויקות.
שלב 2: אחזור (קורה בכל שאלה). כשמגיעה שאלה, היא עוברת אותה המרה, והמערכת מוצאת את הקטעים הקרובים אליה במשמעות. לרוב חמישה עד עשרה קטעים.
שלב 3: יצירה. הקטעים שנמצאו נשלחים למודל יחד עם השאלה ועם הנחיה ברורה: ענה מתוך המידע הזה בלבד, ואם אין בו תשובה — אמור שאין.
המודל משמש כאן כמנוע הבנה וניסוח, לא כמאגר ידע. זה ההבדל שקובע הכול.
למה זה עדיף על אימון מודל
השאלה "למה לא פשוט לאמן מודל על הנתונים שלנו" מגיעה כמעט תמיד, וארבע סיבות עונות עליה.
עדכניות. שינוי מחירון ב-RAG הוא החלפת מסמך — התוצאה משתנה מיד. במודל מאומן זה דורש אימון מחדש, כלומר זמן וכסף בכל שינוי.
שקיפות. ב-RAG אפשר להצביע על המקור לכל תשובה. מודל מאומן לא יכול לומר מאיפה הגיעה תשובה, וזה קריטי כשמדובר במחיר או במדיניות.
הרשאות. אפשר לסנן אילו מסמכים זמינים למי בזמן החיפוש. במודל מאומן, הידע מוטמע בו ואי אפשר להפריד.
עלות. RAG זול משמעותית להקמה ולתחזוקה.
מתי אימון (fine-tuning) כן מוצדק: כשרוצים לשנות סגנון או פורמט תשובה באופן עקבי — לא כדי להוסיף עובדות. השניים משלימים ולא מתחרים, ורוב העסקים צריכים רק את הראשון.
איפה RAG נשבר בפועל
הרעיון פשוט; הביצוע פחות. ארבע נקודות הכשל שאני פוגש הכי הרבה.
חיתוך גרוע
אם מסמך נחתך לפי מספר תווים קבוע, קטע יכול להסתיים באמצע רעיון. המערכת תמצא את הקטע הנכון והמודל יקבל חצי הקשר — ואז ישלים את השאר בעצמו. חיתוך צריך להיות לפי מבנה: סעיף, כותרת, שאלה.
פער שפה
המסמך כתוב בשפה משפטית או מקצועית, והלקוח שואל במילים אחרות לגמרי. "מה קורה אם אני רוצה לבטל?" מול מסמך שכותרתו "תנאי סיום התקשרות". החיפוש לפי משמעות מטפל בזה חלקית, אבל לא תמיד. הפתרון המעשי: להוסיף לכל מסמך שורות של "איך שואלים על זה בפועל".
מסמכים סותרים
שני מחירונים בתיקייה, אחד ישן. המערכת תמצא את שניהם, והמודל יבחר. מסמך סותר אחד מזיק יותר מעשרה חסרים.
שאלות שדורשות חישוב או צבירה
"כמה לקוחות עזבו ברבעון האחרון" היא לא שאלת אחזור אלא שאילתת נתונים. RAG לא נועד לזה, וניסיון לכפות עליו את זה מייצר תשובות שגויות בביטחון. לשאלות כאלה צריך חיבור למסד נתונים, לא לחיפוש מסמכים.
איך נראה מסמך שעובד טוב עם RAG
אותו תוכן בדיוק יכול לתת תוצאות שונות לגמרי לפי איך שהוא כתוב. ארבעה כללים פרקטיים שמשפרים את התוצאה יותר מכל אופטימיזציה טכנית.
כותרות מפורשות. "מדיניות ביטול הזמנה" עדיף על "סעיף 4.2". הכותרת נכנסת לקטע ומשפיעה על החיפוש.
כל סעיף עומד בפני עצמו. מסמך שכתוב "כאמור לעיל" ו"בהתאם לסעיף הקודם" מייצר קטעים שאין להם משמעות בנפרד. עדיף לחזור על ההקשר גם במחיר חזרתיות.
מספרים ותאריכים במפורש. "תוך 14 ימי עסקים" ולא "בזמן סביר". מודל לא יכול לדייק במה שלא כתוב.
ניסוח בשפת השואל. אם הלקוחות שואלים "אפשר להחזיר?", כדאי שהמילה "להחזיר" תופיע במסמך ולא רק "השבת טובין".
הכלל הכללי: מסמך שנכתב כדי שאדם זר יבין אותו בלי הקשר נוסף — יעבוד טוב גם עם RAG. זה גם למה השקעה בסידור הידע משתלמת פעמיים.
מה משפר את התוצאה בפועל
אחרי שהבסיס עובד, ארבעה שיפורים שנותנים את התמורה הגדולה ביותר:
- חיפוש היברידי — שילוב של חיפוש לפי משמעות עם חיפוש מילולי רגיל. קריטי למק"טים, שמות דגמים ומספרי סעיפים, שבהם דמיון משמעות לא עוזר.
- דירוג מחדש — שלב שני שבוחר מתוך העשרה שנמצאו את השלושה הרלוונטיים באמת. משפר דיוק משמעותית בעלות נמוכה.
- מטא-דאטה — תאריך, מחלקה, סוג מסמך, תוקף. מאפשר לסנן לפני החיפוש ולהעדיף מסמכים עדכניים.
- סף ביטחון — אם לא נמצא קטע רלוונטי מספיק, לא לענות אלא להעביר לאדם.
איך יודעים שזה עובד
הרבה פרויקטים נמדדים בתחושה, וזו טעות. שלושה מדדים שאפשר לבנות בשבוע:
קבוצת שאלות בדיקה. 30–50 שאלות אמיתיות עם התשובות הנכונות, שנכתבו על ידי מי שמכיר את התחום. כל שינוי במערכת נבדק מולן. בלי זה, כל "שיפור" הוא ניחוש.
דיוק האחזור בנפרד מדיוק התשובה. אם הקטע הנכון לא נמצא — הבעיה בחיפוש. אם נמצא והתשובה שגויה — הבעיה בהנחיה או בחיתוך. שני תיקונים שונים לגמרי.
שיעור "אין לי מידע". צריך להיות קיים. אפס אחוז אומר שהמערכת ממציאה, וזה גרוע יותר משיעור גבוה.
איך מתחזקים את המאגר לאורך זמן
זו נקודת הכישלון הנפוצה ביותר אחרי חצי שנה, והיא ניתנת למניעה בשלוש החלטות שמקבלים בהתחלה.
עדכון מחליף, לא מתווסף. כשמסמך מתעדכן, הגרסה הישנה יוצאת מהמאגר. אם היא נשארת, המערכת תמצא את שתיהן ותבחר — ולא בהכרח נכון. זה נשמע טריוויאלי וזו התקלה מספר אחת בפועל.
תאריך תוקף שמייצר התראה. מסמך שעבר תוקף לא צריך להישאר בשקט. עדיף שהמערכת תסמן אותו מאשר שתענה ממנו.
בעלים לכל תחום ידע. שם אחד למחירון, אחד לנהלים, אחד למוצרים. "כולם אחראים" פירושו אף אחד, וזה נראה כעבור חצי שנה.
ובנוסף — כדאי להריץ את קבוצת שאלות הבדיקה פעם בחודש. אם התשובות השתנו לרעה בלי ששיניתם משהו במערכת, סימן שמשהו במאגר השתנה.
מה צריך בשביל להתחיל
פחות ממה שנדמה. מסד נתונים וקטורי (יש כאלה מנוהלים וזולים), גישה למודל שפה, ותהליך שמכניס מסמכים פנימה ומעדכן אותם.
מה שבאמת דורש עבודה הוא לא התשתית אלא הידע: לאסוף אותו למקום אחד, לוודא שאין גרסאות סותרות, לסמן תוקף ובעלים, ולתעד את מה שקיים רק בעל פה. בפרויקטים שאני מלווה, זה בין שני שלישים לשלושה רבעים מהמאמץ — וזה גם החלק שנשאר בעל ערך גם אם תחליפו טכנולוגיה.
כמה זה עולה
פתרון RAG ממוקד על גוף ידע מסודר יחסית ובערוץ אחד מתחיל בסביבות 12,000–15,000 ₪. מערכת רחבה יותר, עם כמה סוגי מסמכים, הרשאות לקבוצות שונות וחיבור למספר ערוצים, נעה בטווח גבוה יותר.
העלות השוטפת נמוכה: אחסון וקטורי הוא זול, ועלות המודל לרוב עשרות עד מאות שקלים בחודש. מה שכן דורש תקציב קבוע הוא עדכון הידע — וזה תקציב שכדאי להגדיר מראש, כי בלעדיו המערכת מתיישנת.
הגורם שמזיז את המחיר יותר מכל הוא מצב הידע, לא כמות המסמכים. פירוט על מבנה העלות בכמה עולה להטמיע AI בעסק.
מאיפה מתחילים
בחרו תחום ידע אחד ומוגדר — מדיניות ושאלות נפוצות למשל — במקום לנסות להזין את כל העסק. מערכת שעונה מצוין על עשרים שאלות שווה יותר מאחת שעונה בינוני על מאתיים, וההרחבה אחר כך היא הרבה יותר קלה מהתיקון.
על הצד המעשי של בניית בוט על הידע הזה כתבתי בצ'אטבוט שמכיר את הידע הפנימי, ועל השימוש הפנימי לעובדים בעוזר AI פנימי.
ולפני שמבקשים הצעות — טווחי המחירים המלאים נמצאים במדריך מחירי צ'אט בוטים.