בעבר, כשרצינו לבצע בדיקות איכות של תוכנה קלאסית, יכולנו לעשות את זה באופן מוחלט: טסט שמורכב מקלט מסוים יצר פלט יחיד וצפוי. היום אייג׳נטים פועלים בסביבה לא דטרמיניסטית, מה שמשנה לגמרי את היכולת שלנו לבדוק את איכות הפעולה שלהם ועד כמה הצליחו במשימה שקיבלו.
בפרק השבוע, דריה ורטהיים מדברת עם רועי מן, קו-פאונדר וקו-CEO במאנדיי, ועם מתן לחמיש, שמוביל את הסטארטאפ הפנימי ״טאקה״, על האתגרים בבדיקת אייג׳נטים, על שאלות כמו מה היא בכלל תוצאה טובה, על פירוק התוצאה הזו לקריטריונים מדידים, על איסוף פידבק, ועל דרכים פרקטיות לבחינת איכות כשהתוצאה אינה צפויה לחלוטין.
רועי ומתן משתפים בכך שאי אפשר לחזות מראש את כל התרחישים, ולכן סביבת הפרודקשן הופכת למקור האמת המרכזי, שבה לוקחים את הטעויות בזמן אמת והופכים כשלים לטסטים שהגרסאות הבאות צריכות לעבור. הם מסבירים את הצורך בתשתיות בדיקה המשלבות בדיקות טכניות יחד עם AI כ״שופט״ (LLM-as-a-Judge) שמעריך את תכונות האופי של האייג׳נט, ובודק האם התוצאה הסופית עמדה בציפיות. בנוסף, הם מדברים על החשיבות של שמירה על פוקוס באמצעות Sub-Agents וצמצום הקונטקסט, ואיך בסופו של דבר כרגע אי אפשר להימנע מטעויות של אייג׳נטים.
אם גם אתם בונים אייג׳נטים ופוגשים את אותם אתגרים – האזינו לפרק!