משימות סוכן ארוכות הכוללות תכנון, קריאות לכלים, הפרעות, תצפיות ביניים ותתי־מטרות מקומיות משתנות.
האם סוכני LLM ארוכי־טווח עדיין פועלים למען המטרה המקורית של המשתמש אחרי עשרות צעדים?
מודדים סטייה מהמטרה לאורך מסלולים ארוכים של סוכני LLM ובודקים נקודות ביקורת קלות שמחזירות את כוונת המשתמש בלי להתחיל את התהליך מחדש.
נקודות ביקורת תקופתיות של כוונת המשתמש, המופעלות כאשר מזוהה סטייה בתוכנית, יפחיתו פעולות סופיות שאינן תואמות את המטרה ב-25% לפחות, עם תוספת של פחות מ-5% בטוקנים.
שיעור המשימות שהושלמו כאשר הפעולה הסופית נשארת תואמת למטרה ולאילוצים המקוריים של המשתמש.
לפחות 25% פחות פעולות סופיות שאינן תואמות למטרה, עם פחות מ-5% טוקנים נוספים.
סוכני LLM ארוכי־טווח אמינים יותר וראיות ברורות יותר לגבי מתי התזמור צריך לעצור, לחדש או לבקש קלט אנושי.
כללי החלטה
לשחזר במספר מסגרות סוכנים ובמסלולים ארוכים יותר.
להפעיל נקודות ביקורת רק בשינויי מצב בעלי סיכון גבוה יותר.
לא להוסיף נקודות ביקורת כמנגנון תזמור כללי.
תוצאות עסקיות הן יעדי מחקר ולא הבטחות. גם תוצאה אפסית או שלילית עשויה ליצור ערך משמעותי באמצעות מניעת השקעה במוצר, תכונה או קמפיין שאינם יעילים.
נקודות ביקורת קומפקטיות שמשוות את התוכנית הנוכחית ואת הפעולה הסופית המתוכננת למטרה ולאילוצים המקוריים של המשתמש.
אותו תהליך ארוך ללא נקודות ביקורת מפורשות למטרה.
הצלחת המשימה · התאוששות מהפרעה · טוקנים נוספים · שיעור התראות שווא של נקודת הביקורת