הבנצ׳מרק כבר הוכרע. ייתכן שללקוח שלכם זה כלל לא משנה.

מחקר שדה בקרב 5,179 נציגי תמיכה מצא שעוזר AI הגדיל את מספר הפניות שנפתרו בשעה ב־14% בממוצע וב־34% אצל עובדים מתחילים ובעלי מיומנות נמוכה יותר. אצל הנציגים החזקים ביותר כמעט שלא נמצא שיפור. במילים אחרות, אותו מודל לא היה אותו מוצר עבור כולם: ערכו השתנה מאוד לפי האדם, פער הידע ותהליך העבודה שסביבו.

שני ניסויים מוקדמים מחזקים את הדפוס. במשימות כתיבה מקצועית מוגדרות, 453 משתתפים סיימו 40% מהר יותר והפיקו עבודה שקיבלה ציונים גבוהים ב־18%. במחקר בקרב 758 יועצים, AI שיפר מהירות ואיכות בתוך גבול היכולת שלו, אך הפחית ב־19 נקודות אחוז את הסיכוי לתשובה נכונה במשימה שמחוץ לגבול הזה. היכולת חשובה; התאמת המשימה קובעת אם היא תהפוך לעזרה או לנזק.

תוצאת התמיכה היא רמז, לא הבטחה אוניברסלית

המחקר הגדול Generative AI at Work חשוב מפני שהוא מדד עבודה ממשית, לא התלהבות. בקרב 5,179 נציגים, הגישה לעוזר AI העלתה את הפרודוקטיביות בכ־14%, עם רווח גדול יותר אצל עובדים פחות מנוסים. המנגנון לא היה פשוט ״מודל חכם יותר״. המערכת הנגישה דפוסים של העובדים החזקים בתוך תהליך עבודה מסוים, בדיוק ברגע שבו הנציג יכול היה להשתמש בהם.

כך כדאי לקרוא מקרי בוחן של AI. הלקח שניתן להעביר אינו גודל האפקט, אלא השרשרת: ידע ארגוני רלוונטי, שמופיע בתוך משימה אמיתית, בפני אדם שמוסמך לפעול, ונמדד בתוצאה תפעולית. נתקו חוליה אחת והמודל עלול להפוך להשלמה אוטומטית יקרה. שחזרו את השרשרת, ואפילו מודל לא מושלם עשוי לייצר ערך ממשי.

״שימושי״ זקוק להגדרה עסקית

AI ממוקד־אדם מתחיל בהעצמת אנשים ובמענה לצרכים אנושיים. ההגדרה הזאת נעשית תפעולית רק כשצוות מוצר שואל: שימושי למי, באיזה שלב, תחת אילו מגבלות, ובאיזו התנהגות נראה את השינוי? ״התשובה טובה יותר״ עדיין אינה טענה מסחרית.

בעוזר רכש, שימושיות עשויה להיות פחות סיכונים חוזיים שהוחמצו בלי להאט את הבדיקה. בעוזר קניות לצרכן, היא עשויה להיות פחות נטישות ופחות החזרות מתוך חרטה. עבור רופא, היא יכולה להיות הסלמה בהתאם לפרוטוקול, כשהאי־ודאות מוצגת בבירור. ציון כללי אחד של ״איכות תשובה״ מוחק את ההבדלים בין העבודות האלה ועלול לגרום למודל טוב יותר להיראות כעסק טוב יותר גם כששום דבר חשוב לא השתנה.

מצאו את הדליפה שבין תשובה לפעולה

מפו מסלול אחד בעל משמעות — מהשאלה ועד לפעולה. אחרי שהתשובה מופיעה, היכן הערך דולף? אולי המשתמשים קוראים שוב פסקה צפופה, אינם מצליחים להשוות חלופות, מחמיצים אזהרה, אינם מאמינים להמלצה נכונה, או צריכים להעתיק את התשובה לכלי אחר. אלה אינם פרטי UX משניים. אלה מנגנונים סיבתיים אפשריים בין פלט המודל לתוצאה העסקית.

כאן מדעי הרוח והעיצוב נעשים מעשיים. רטוריקה עוזרת להבדיל בין ראיה לטענה. עיצוב מידע חושף קשרים. פסיכולוגיה מסייעת לצפות ביטחון־יתר, עומס והימנעות. אתנוגרפיה מגלה מעקפים מקומיים שאינם מופיעים באנליטיקה. אף אחד מהכלים האלה לא הופך את המודל ל״חכם יותר״ בטבלת המובילים; כל אחד מהם יכול להפוך את האינטליגנציה שכבר קיימת לשימושית יותר לאדם אמיתי.

הבדיקה הראשונה שהייתי מריץ

בחרו תשובה שכבר נכונה דיה מבחינה עובדתית ועצבו מחדש רק את השכבה האנושית שלה. השאירו קבועים את המודל, האחזור והעובדות. השוו בין התשובה הנוכחית לגרסה שמאורגנת סביב החלטת הלקוח: המלצה במשפט אחד, הראיות, אי־הוודאות, החלופות והפעולה הבטוחה הבאה. הגדירו מראש מדד התנהגותי ראשי ומדד הגנה אחד לסיכון.

אם ההבנה משתפרת אך הפעולה אינה משתנה, הדליפה נמצאת בהמשך המסלול. אם הפעולה עולה יחד עם שיעור הטעות, העיצוב משכנע אך אינו בטוח. אם שום דבר לא זז, הפסיקו ללטש וחפשו מנגנון אחר. לבדיקה הזאת יש תפקיד אחד: לגלות אם העיצוב המסוים הזה עוזר ללקוח המסוים הזה לקבל את ההחלטה המסוימת הזאת.