1. היכולת נעשתה שופעת; הרלוונטיות נעשתה נדירה יותר
ראיות השנה הגיעו הרבה מעבר לדמואים: 5,179 נציגי תמיכה, 6,000 עובדי ידע, 301 משתתפים ששפטו אי־ודאות ומחקרי ממשק שבהם משטחי משימה שנוצרו בזמן אמת הועדפו ביותר מ־70% מהמקרים. הממצא המשותף היה שונות. אותו AI עזר למתחילים יותר מאשר למומחים, לדוא״ל יותר מאשר לפגישות ולחלק מהמשימות יותר מאחרות.
אין בכך כדי להפחית מחשיבות מחקר המודלים. צוואר הבקבוק פשוט השתנה. טיפוגרפיה אינה יכולה להציל מודל חלש. אך מרגע שתשובות עוברות סף יכולת, ערך הלקוח עשוי להיות תלוי יותר במערכת שסביבן מאשר בעוד שיפור קטן בבנצ׳מרק. אסטרטגיית המוצר צריכה לבדוק היכן הסף נמצא, במקום להניח שהלקוחות מרגישים כל תוספת יכולת.
2. התחום עבר מצ׳אט לתשובות שמקבלות את צורת המשימה
מחקר על ממשקים גנרטיביים וגמישים הראה שתשובת LLM יכולה להפוך לטבלה, משטח שליטה, השוואה או מרחב מידע שמתפתח. צ׳אט נשאר כלי רב־עוצמה לביטוי כוונה ולשאלות המשך. הוא אינו חייב להיות הייצוג הסופי של כל משימה.
הזדמנות העיצוב אינה חידוש בלתי־מוגבל, אלא התאמה בין משימה, מבנה מידע ושליטה. ממשקים שנוצרים בזמן אמת צריכים להשתמש בכללי עיצוב יציבים, באילוצי נגישות ובנתוני העדפה אמיתיים. אחרת המערכת מחליפה את הצפיות של קיר טקסט באי־הצפיות של אפליקציה מאולתרת.
3. ערך אדם–AI הופיע בתוך מערכות עבודה
ראיות השדה מתמיכת לקוחות הראו כיצד עוזר יכול להפיץ דפוסים מועילים ולהעלות פרודוקטיביות מדודה, במיוחד אצל עובדים פחות מנוסים. מחקרי עבודה אחרים הראו את המגבלה: עבודה שאדם יכול לשנות לבדו זזה בקלות רבה יותר משגרות מתואמות. AI משתתף בארגונים, לא בחלל ריק.
לכן יחידת העיצוב הבוגרת היא תהליך עבודה סוציו־טכני: אנשים, מודל, ידע, הרשאות, העברות, תמריצים, למידה ואחריות. עוזר יכול לשפר שלב אחד ולהחמיר את המערכת באמצעות עבודה חוזרת או אובדן מיומנות. ההערכה צריכה לעקוב אחר העבודה מספיק רחוק כדי לראות את האפקט נטו.
4. יותר אמון ופחות חשיבה הפסיקו להיראות כניצחונות פשוטים
מחקר CHI של עובדי ידע קישר בין ביטחון גבוה יותר ב־GenAI לפחות מאמץ מדווח של חשיבה ביקורתית. מחקר על אי־ודאות, חנופה וטון הסבר מסבך באופן דומה את היעד של עוזר נטול חיכוך שתמיד מסכים. תשובה יכולה להרגיש אמינה מסיבות שאינן קשורות לאמינותה בפועל.
המדד הצופה קדימה הוא הסתמכות מכוילת. האם לקוחות יכולים לקבל עצה חזקה, לערער על עצה חלשה ולדעת מתי להסלים? האם הממשק יכול להשאיר אותם מעורבים קוגניטיבית בנקודות שבהן השיפוט חשוב, ובו בזמן להסיר מאמץ שאינו מוסיף ערך? צריך להבדיל בין חיכוך טוב לרע, לא למחוק את שניהם.
5. הערכה הפכה לבעיה של מדעי הרוח והחברה
עבודה על הערכה כמדידה הופכת למפורש את מה שצוותי מוצר מגלים מאוחר: שימושיות, רלוונטיות, הוגנות, התאמה תרבותית ואמון אינם כמויות טבעיות יחידות. אלה מושגים שדורשים תיאוריה, בעלי עניין, הקשר וכלים שתוקפו. מחקר רב־לשוני מראה עד כמה בקלות ציון של שטף יכול להסתיר חוסר התאמה תרבותית.
סדר היום של 2026 נובע מן השינויים האלה. עצבו את התשובה כהתערבות. ציינו איזו התנהגות אנושית ואיזו החלטה עסקית היא אמורה לשנות. הכניסו פרוטוקול ואילוצי נגישות אל תוך היצירה. בדקו עם האנשים שנושאים בתוצאה. פרסמו ממצאים אפסיים ושליליים. המודל יכול להיות תשתית אוניברסלית; תשובה שימושית תמיד תלויה במצב.