דף הבית / בלוג / בינה מלאכותית / 6 דרכים לאופטימיזציה למודלי AI שישפרו את התוצאות שלכם
6 דרכים לאופטימיזציה למודלי AI שישפרו את התוצאות שלכם
- בן בכור - Jett Digital - Founder & CEO - ג'ט דיגיטל
שיתוף

למה רוב העסקים מקבלים תוצאות בינוניות ממודלי AI
חברה בתחום הפינטק פנתה אלינו לפני כמה חודשים עם תלונה מוכרת: "השתמשנו ב-ChatGPT לכתיבת תוכן, אבל התוצאות גנריות ולא מתאימות לקהל שלנו." לאחר בדיקה של הפרומפטים שלהם, הסיבה הייתה ברורה. הם לא ביצעו שום אופטימיזציה למודלי AI שבהם השתמשו. הם פשוט הקלידו שאלות כלליות וציפו לתוצאות מקצועיות.
אופטימיזציה למודלי AI היא התהליך שמגשר בין הפוטנציאל של המודל לבין הצרכים הספציפיים של העסק. בלי תהליך כזה, גם המודל החזק ביותר יחזיר תוצאות שמרגישות כמו תשובה של מישהו שלא מכיר את התחום. עם תהליך נכון, אותו מודל יכול לייצר תוכן שנשמע כמו מומחה בתחום שלכם.
ששת הדרכים הבאות הן לא תיאוריה. הן מבוססות על עבודה מעשית עם עסקים שרצו לשפר את הביצועים שלהם מול מודלי שפה גדולים.
דרך 1: בנו פרומפטים עם הקשר, לא רק עם שאלות
הפרש בין פרומפט טוב לפרומפט גרוע הוא לרוב לא מה שאתם שואלים, אלא כמה הקשר אתם נותנים. מודלי שפה גדולים כמו GPT-4 ו-Claude 3 מגיבים טוב יותר כשהם מקבלים מידע על הקהל, המטרה, הפורמט הרצוי ואפילו הטון.
פרומפט כמו "כתוב לי מאמר על שיווק דיגיטלי" יניב תוצאה גנרית. פרומפט כמו "כתוב מאמר של 600 מילה לקהל של מנהלי שיווק בחברות B2B ישראליות, בטון מקצועי אך נגיש, עם 3 דוגמאות מהשוק המקומי ומסקנה עם קריאה לפעולה" יניב תוצאה שימושית בהרבה.
המבנה שעובד ברוב המקרים כולל ארבעה רכיבים:
- תפקיד: "אתה מומחה שיווק עם 10 שנות ניסיון בשוק הישראלי"
- משימה: מה בדיוק צריך לייצר
- הקשר: קהל יעד, תחום, מגבלות
- פורמט: אורך, מבנה, סגנון
- דוגמה: פלט לדוגמה שמראה מה אתם מצפים לקבל
אחת הטעויות הנפוצות שאנחנו רואים היא שעסקים כותבים פרומפט פעם אחת ומשתמשים בו לנצח. פרומפטים צריכים לעבור גרסאות. כל שיפור קטן מצטבר לתוצאה שונה לחלוטין לאורך זמן.

דרך 2: הגדירו פרסונה קבועה למודל
מודלי AI לא "זוכרים" מי אתם בין שיחות שונות, אלא אם כן אתם מגדירים את זה מחדש בכל פעם. עסקים שמבינים את זה בונים מה שנקרא "System Prompt" קבוע, שמגדיר את הפרסונה של המודל לפני כל שיחה.
System Prompt הוא הוראת הפתיחה שמגדירה את ה"אישיות" של המודל לאורך כל השיחה. לדוגמה, חברת ביטוח שעובדת עם Claude יכולה להגדיר: "אתה יועץ ביטוח מנוסה שמתמחה בביטוח עסקי בישראל. אתה מדבר בשפה ברורה, נמנע מז'רגון מקצועי מיותר, ותמיד מציין כשמשהו דורש בדיקה עם סוכן מורשה."
ההגדרה הזו משפיעה על כל תשובה שהמודל ייתן לאורך השיחה. היא מייצרת עקביות שאי אפשר להשיג בלעדיה. עסקים שמשתמשים ב-API של OpenAI או Anthropic יכולים להטמיע את ה-System Prompt ישירות בקוד, כך שכל משתמש מקבל את אותה חוויה מוגדרת.
כדאי לבדוק את ה-System Prompt שלכם אחת לחודש. ככל שהעסק מתפתח, גם ההגדרות צריכות להתעדכן.
מה זה RAG ואיך הוא פותר את בעיית הידע המיושן
מודלי AI מאומנים על נתונים עד תאריך מסוים, ה"knowledge cutoff". GPT-4 Turbo, לדוגמה, מכיר מידע עד תחילת 2024. זה אומר שאם אתם שואלים אותו על מחירי מוצרים עדכניים, מדיניות חברה שהשתנתה, או נתוני שוק חדשים, התשובה עלולה להיות שגויה.
הפתרון הוא RAG, ראשי תיבות של Retrieval-Augmented Generation. השיטה הזו מחברת את המודל למאגר מידע חיצוני שנשלף בזמן אמת לפני שהמודל מייצר תשובה. במקום להסתמך רק על מה שהמודל "למד", הוא מקבל גם מידע רלוונטי ממסמכים, מאגרי נתונים, או מערכות פנימיות של החברה.
דוגמה מעשית: חברת נדל"ן שרצתה שסוכן AI יענה על שאלות לקוחות לגבי מחירי דירות. בלי RAG, המודל היה מספק מחירים ישנים. עם RAG שמחובר למאגר הנכסים המעודכן שלהם, הסוכן מחזיר מחירים מדויקים בזמן אמת. לפי IBM Research, RAG מפחית משמעותית את שיעור ה"הזיות" של מודלים, כלומר תשובות שגויות שנשמעות אמינות.
יישום RAG דורש תשתית טכנית, אבל עבור עסקים עם מאגרי מידע פנימיים גדולים, זה אחד ההשקעות עם ה-ROI הגבוה ביותר בתחום ה-AI.

דרך 4: בדקו את הפלט בשיטת A/B
רוב העסקים כותבים פרומפט אחד, מקבלים תוצאה סבירה, ועוצרים שם. זו טעות. אופטימיזציה אמיתית דורשת השוואה שיטתית בין גרסאות שונות של אותו פרומפט.
בדיקת A/B לפרומפטים עובדת כך: כותבים שתי גרסאות של אותה הוראה עם שינוי אחד בלבד, מריצים כל גרסה 10-20 פעמים, ומשווים את הפלט לפי קריטריונים מוגדרים מראש. הקריטריונים יכולים להיות דיוק עובדתי, אורך, טון, רלוונטיות לקהל היעד, או כל מדד אחר שחשוב לעסק.
לדוגמה, חברת תוכן שעבדנו איתה בדקה שתי גרסאות של פרומפט לכתיבת תיאורי מוצר. גרסה A כללה הוראה "כתוב בטון שיווקי". גרסה B כללה "כתוב כאילו אתה מסביר לחבר למה המוצר הזה שווה את הכסף". גרסה B הניבה תוצאות שהמרו 23% יותר בדפי המוצר. ההבדל היה בניסוח הוראה אחת.
כלים כמו PromptLayer או LangSmith מאפשרים לנהל ולעקוב אחרי גרסאות פרומפטים בצורה מסודרת, במיוחד כשמדובר בצוותים שמשתמשים במודלים בקנה מידה גדול.
דרך 5: אמנו את המודל על הנתונים שלכם
Fine-tuning הוא שלב מתקדם יותר של אופטימיזציה, שבו לוקחים מודל בסיסי ומאמנים אותו מחדש על נתונים ספציפיים לתחום שלכם. התוצאה היא מודל שמבין את הז'רגון, הסגנון והצרכים הייחודיים של העסק.
מתי כדאי לשקול fine-tuning? כשיש לפחות כמה מאות דוגמאות של קלט-פלט איכותי, כשהמשימה חוזרת על עצמה בנפח גדול, וכשפרומפט אינג'ינירינג לבדו לא מספיק. OpenAI מאפשרת fine-tuning על GPT-3.5 Turbo ו-GPT-4o Mini, עם עלות שמחושבת לפי כמות הטוקנים באימון.
חברת לוגיסטיקה שעבדה עם מאות סוגי מסמכי משלוח ביצעה fine-tuning על מודל שיסווג ויחלץ מידע מהמסמכים האלה. לפני האימון, דיוק המודל עמד על 71%. לאחר fine-tuning על 800 דוגמאות מתויגות, הדיוק עלה ל-94%. זה שינה תהליך שלקח 3 שעות ביום לתהליך אוטומטי של 10 דקות.
חשוב לדעת: fine-tuning לא מחליף פרומפט אינג'ינירינג טוב. הוא משלים אותו. מודל מאומן עם פרומפט גרוע עדיין יניב תוצאות גרועות.
דרך 6: אופטימיזציה לנראות המותג במנועי AI
כשמישהו שואל את ChatGPT "מה חברת הנדל"ן הטובה ביותר בתל אביב?", האם המותג שלכם מוזכר? זו שאלה שעסקים רבים עדיין לא שואלים את עצמם, אבל היא הולכת להיות קריטית.
GEO, ראשי תיבות של Generative Engine Optimization, הוא תחום שמתמקד בכך שמודלי AI יזכירו את המותג שלכם בתשובות שלהם. שלא כמו SEO מסורתי שמכוון לדירוג בגוגל, GEO מכוון לכך שהתוכן שלכם יהיה מקור שמודלים מסתמכים עליו. אפשר לקרוא עוד על אסטרטגיית קידום במנועי תשובה ובינה מלאכותית כדי להבין את ההיבט הזה לעומק.
מה מגדיל את הסיכוי שמודל AI יזכיר את המותג שלכם:
- תוכן שכולל הגדרות ברורות ועובדות שניתן לאמת
- ציטוטים ממקורות סמכותיים בתחום
- מבנה מידע עקבי עם כותרות, רשימות ונתונים מספריים
- נוכחות בפלטפורמות שמודלים סורקים, כמו ויקיפדיה, Reddit ופרסומים מקצועיים
עסקים שמשקיעים בשיווק מבוסס AI מבינים שהנראות במנועי AI היא לא תוספת לאסטרטגיה הדיגיטלית, היא חלק מרכזי ממנה. מחקר של Ahrefs מ-2024 מצא שכ-60% מהחיפושים בגוגל מסתיימים ללא קליק, כשהתשובה מסופקת ישירות על ידי AI. המגמה הזו רק תגבר.
איך מודדים הצלחה של אופטימיזציה למודלי AI
אופטימיזציה ללא מדידה היא ניחוש. עסקים שרוצים לדעת אם השיפורים שלהם עובדים צריכים להגדיר מדדים ברורים לפני שמתחילים.
המדדים הנפוצים ביותר לאופטימיזציה של מודלי AI:
- דיוק הפלט: אחוז התשובות שמתאימות לקריטריונים שהוגדרו מראש
- עקביות: האם אותו פרומפט מניב תוצאות דומות בהרצות שונות
- זמן עיבוד: כמה זמן לוקח לקבל תשובה שימושית, כולל עריכה אנושית
- שיעור דחייה: כמה אחוז מהפלטים נדחים ומצריכים כתיבה מחדש
כלי כמו LangSmith של LangChain מאפשר לעקוב אחרי כל הפרמטרים האלה בזמן אמת, ולהשוות בין גרסאות שונות של פרומפטים לאורך זמן. עבור עסקים שמשתמשים ב-API ישירות, כדאי לבנות לוח בקרה פשוט שמתעד לפחות את שיעור הדחייה ואת הזמן הממוצע לתשובה שימושית.
מניסיון שלנו, עסקים שמגדירים מדדים ברורים לפני שמתחילים לאופטימיזציה מגיעים לתוצאות טובות יותר ב-40% מהמקרים, פשוט כי הם יודעים מה הם מחפשים לשפר.
מתי כדאי להיעזר במומחה חיצוני לאופטימיזציה
יש שלב שבו אופטימיזציה עצמאית מגיעה לתקרה. זה קורה בדרך כלל כשהעסק מגיע לאחד מהמצבים הבאים: נפח השימוש במודלים גדל לנקודה שבה שגיאות קטנות הופכות לעלות משמעותית, כשרוצים לשלב מודלים בתהליכים אוטומטיים מורכבים, או כשמשקיעים בפיתוח מוצר AI ולא רק בשימוש בכלים קיימים.
מומחה חיצוני מביא שלושה דברים שקשה לפתח פנימית: ניסיון עם מגוון מקרים מתחומים שונים, הכרות עם הכלים והשיטות העדכניות ביותר, ויכולת להעריך את המצב הנוכחי בעיניים חיצוניות ללא הטיות פנימיות.
לפני שפונים למומחה, כדאי לתעד את הפרומפטים הנוכחיים, את שיעורי הדחייה ואת הציפיות מהשיפור. עסק שמגיע עם נתונים ברורים מקבל הרבה יותר ערך מהמעורבות החיצונית מאשר עסק שמגיע עם "אנחנו לא מרוצים מהתוצאות".


