لقد فاز النموذج المعياري. وربما لا يهتم عميلكم.

وجدت دراسة ميدانية شملت 5,179 موظف دعم أن مساعد AI رفع عدد المسائل المحلولة في الساعة بنسبة 14% في المتوسط، وبنسبة 34% لدى الموظفين المبتدئين والأقل مهارة، بينما لم يقدّم فائدة تذكر لأقوى الموظفين. لذلك لم يكن النموذج نفسه منتجاً واحداً للجميع؛ فقد تغيّرت قيمته بوضوح باختلاف الشخص وفجوة المعرفة ومسار العمل المحيط به.

تجربتان أقدم تجعل هذا النمط أصعب على التجاهل. في مهام كتابة مهنية محددة، أنهى 453 مشاركاً العمل أسرع بـ40% وحصلت مخرجاتهم على تقييم أعلى بـ18%. وفي دراسة شملت 758 مستشاراً، حسّن AI السرعة والجودة داخل حدود قدرته، لكنه خفّض احتمال الوصول إلى الإجابة الصحيحة بـ19 نقطة مئوية في مهمة تقع خارجها. القدرة مهمة؛ أما ملاءمة المهمة فتحدد إن كانت القدرة ستصبح مساعدة أم ضرراً.

نتيجة دعم العملاء قرينة، وليست وعداً عاماً

تكمن قيمة الدراسة الكبيرة Generative AI at Work في أنها قاست العمل لا الانبهار. بين 5,179 موظف دعم، رفعت إتاحة مساعد AI الإنتاجية بنحو 14%، مع مكاسب أكبر لدى الأقل خبرة. لم تكن الآلية مجرد «نموذج أذكى». فقد أتاحت المنظومة أنماط عمل الموظفين الأقوى داخل مسار محدد، وفي اللحظة التي يستطيع فيها الموظف استخدامها.

ينبغي لهذا أن يغيّر طريقة قراءة الشركات لدراسات حالة AI. الدرس القابل للنقل ليس حجم الأثر، بل السلسلة: معرفة مؤسسية ذات صلة، تظهر داخل مهمة حقيقية، أمام شخص قادر على التصرف، وتُقاس بنتيجة تشغيلية. إذا انقطعت حلقة واحدة فقد يتحول النموذج نفسه إلى إكمال تلقائي باهظ. وإذا أعيد بناء السلسلة فقد يخلق حتى النموذج غير الكامل قيمة ملموسة.

الفائدة تحتاج إلى تعريف تجاري

يبدأ AI المتمحور حول الإنسان من تعزيز قدرات الناس والاستجابة لحاجاتهم. ولا يصبح هذا التعريف قابلاً للتطبيق إلا عندما يسأل فريق المنتج: مفيد لمن، وفي أي خطوة، وتحت أي قيود، وأي سلوك سيكشف ذلك؟ عبارة «الإجابة أفضل» ليست بعدُ ادعاءً تجارياً.

بالنسبة إلى مساعد للمشتريات، قد تعني الفائدة تفويت مخاطر تعاقدية أقل من دون إبطاء المراجعة. وفي مساعد تسوق للمستهلك، قد تعني جلسات مهجورة ومرتجعات ناتجة عن الندم أقل. وللطبيب، قد تعني تصعيداً مطابقاً للبروتوكول مع إظهار عدم اليقين. يختزل مقياس عام واحد لـ«جودة الإجابة» هذه الوظائف المختلفة، وقد يجعل نموذجاً أفضل يبدو كأنه عمل تجاري أفضل رغم أن شيئاً مهماً لم يتغير.

اعثروا على تسرّب القيمة بين الإجابة والفعل

ارسموا رحلة واحدة ذات تبعات من السؤال إلى الفعل. بعد ظهور الإجابة، أين تتسرّب القيمة؟ ربما يعيد المستخدمون قراءة فقرة كثيفة، أو يعجزون عن مقارنة البدائل، أو يفوّتون تحذيراً، أو لا يثقون بتوصية صحيحة، أو يضطرون إلى نسخ الإجابة إلى أداة أخرى. هذه ليست تفاصيل UX ثانوية؛ إنها آليات سببية محتملة بين مخرجات النموذج والنتيجة التجارية.

هنا تصبح العلوم الإنسانية والتصميم أدوات عملية. يميّز التحليل البلاغي بين الدليل والادعاء. ويجعل تصميم المعلومات العلاقات مرئية. ويساعد علم النفس على توقّع الثقة المفرطة والحمل الذهني والتجنب. أما الإثنوغرافيا فتكشف الحلول الالتفافية المحلية التي تغيب عن تحليلات المنتج. لا تجعل أي من هذه الأدوات النموذج «أذكى» على لوحة الترتيب، لكنها قد تجعل ذكاءه الحالي أكثر قابلية للاستخدام من إنسان حقيقي.

الاختبار الأول الذي سأجريه

اختاروا إجابة كافية من الناحية الواقعية، وأعيدوا تصميم طبقتها البشرية فقط. ثبّتوا النموذج والاسترجاع والحقائق الأساسية. قارنوا الإجابة الحالية بنسخة منظّمة حول قرار العميل: توصية في جملة واحدة، ثم الأدلة وعدم اليقين والبدائل والخطوة الآمنة التالية. حدّدوا مسبقاً مقياساً سلوكياً أساسياً وحاجز أمان واحداً للمخاطر.

إذا تحسّن الفهم من دون أن يتغيّر الفعل، فالتسرّب يقع لاحقاً في الرحلة. وإذا ارتفع الفعل والخطأ معاً، فالتصميم مقنع لكنه غير آمن. وإذا لم يتحرك أي منهما، فتوقفوا عن الصقل وابحثوا عن آلية أخرى. لهذا الاختبار مهمة واحدة: معرفة ما إذا كان هذا التصميم بالتحديد يساعد هذا العميل بالتحديد على اتخاذ هذا القرار بالتحديد.