שבע אינו תיאוריה

דמיינו תשובה שקיבלה 7 מתוך 7 ומייצרת בדיוק אותם שיעורי השלמה, המרה, טעות וביקוש לתמיכה כמו התשובה הישנה. הציון השתפר; המוצר לא. גרוע מכך, התשובה יכולה להיות ברורה יותר אך פחות שלמה, משכנעת יותר אך פחות מכוילת, או נעימה יותר ובו בזמן להגדיל את הפעולה הלא נכונה.

שופטי LLM מעצימים את הפיתוי מפני שהם הופכים הערכה לזולה וניתנת להרחבה. הם כלי אבחון מועיל כאשר המושג מוגדר ונבדקת תקפותו. הם אינם הופכים רובריקה מעורפלת לתוצאת מוצר משמעותית. ״איכות כוללת״ נשארת חבילה של ערכים שלא נבדקו, בלי קשר למספר הדוגמאות שקיבלו ציון.

מדידה מתחילה לפני המדד

Wallach ועמיתיו מבדילים בין מושג רקע, מושג שעבר שיטתיות, כלי המדידה והמדידות ברמת המקרה. בשפה פשוטה: החליטו מה משמעותה של שימושיות כאן, הפכו את ההגדרה למפורשת, בחרו תצפיות שמייצגות אותה ובדקו אם התצפיות מצדיקות את הטענה.

תשובת חידוש שימושית יכולה לעזור לבעל חשבון לזהות את התוכנית הנכונה, להבין את שינוי העלות ולפעול בלי תמיכה שניתן היה למנוע — בלי להגדיל חרטה בהמשך. ההגדרה הזאת מובילה לכמה מדדים וגם חושפת עימותים. החלטה מהירה יותר אינה בהכרח טובה יותר; פחות שיחות אינן הצלחה אם לקוחות מבולבלים פשוט ויתרו.

בנו שרשרת מן התשובה אל העסק

אבחוני התשובה נמצאים בתחילת השרשרת: נכונות עובדתית, שלמות פרוטוקול, בהירות, שימוש בראיות וזמן תגובה. אחריהם תוצאות ביניים אנושיות: הבנה, ביטחון מכויל, מאמץ קוגניטיבי, רלוונטיות נתפסת ואמון. בהמשך באה התנהגות: בחירה, ניסיון, הסלמה, השלמה ואימוץ. תוצאות עסקיות מגיעות מאוחר יותר: הכנסה, עלות, שימור, סיכון וערך חיי לקוח.

השרשרת היא השערה סיבתית, לא זהות חשבונאית. תשובה ברורה יותר יכולה לשפר הבנה בלי לשנות המרה מפני שהמחיר דומיננטי. תשובה משכנעת יכולה להגדיל ניסוי בלי שימור מפני שאין ערך במוצר. מדידה של כמה חוליות מאפשרת לצוות לאתר את צוואר הבקבוק במקום להכריז שכל ההתערבות הצליחה או נכשלה.

תוצאה אפסית זקוקה להחלטה

בדיקות A/B מועילות בדיוק מפני שרעיונות עיצוב סבירים יכולים לנצח, לא לעשות דבר או להחמיר את התוצאה. בלוג מלא ניצחונות מלמד צוותים להתאים סיפורים לרעש. תוכנית מחקר צריכה לציין את האפקט המזערי שכדאי לפעול עליו ומה יקרה אם הסף לא יושג.

הגדירו מראש ארבעה מסלולים: להרחיב, לשפר, לעצור או לחקור נזק. שיפור שניתן לזהות סטטיסטית יכול להיות חסר חשיבות מסחרית. ממוצע אפסי יכול להסתיר פלח בעל ערך או פלח שנפגע. תוצאה שלילית יכולה לחסוך לארגון פריסה של מורכבות יקרה בתשובות. ראיות יוצרות ערך כאשר הן משנות החלטה, לא כאשר הן נשארות חיוביות.

התחילו בהחלטה שהראיות חייבות לשנות

בחרו שיפור מוצע אחד וכתבו את מודל המדידה שלו לפני המימוש. ציינו התנהגות לקוח, מנגנון סיבתי, מדד ראשי, מדד הגנה לסיכון, אפקט מזערי בעל משמעות, אוכלוסיית יעד ובעל החלטה. הוסיפו אבחונים רק אם הם מסבירים את התוצאה הראשית. רשמו את כללי הניתוח בתוך הארגון לפני הסתכלות בנתונים.

לאחר מכן הריצו את הבדיקה המבוקרת הקטנה ביותר שהיא עדיין אמינה. אם הצוות אינו יכול לומר איזו פעולה תבוא בעקבות כל תוצאה, הוא אינו מוכן לניסוי. אם אין דרך למדוד את ההתנהגות בעלת ההשלכות, קראו למחקר חוקר במקום להעמיד פנים שמדד מקורב הוא התוצאה. ״האם התשובה השתפרה?״ נעשית שאלה מועילה רק אחרי ״טובה יותר למי, לאיזו החלטה, ואיך נראה זאת?״