ما الذي حدث
نُشرت الورقة في مجلة Science في مارس ٢٠٢٦.
01
شملت النماذج ChatGPT وClaude وGemini وDeepSeek ونماذج Meta.
02
قيّم الناس الردود المجاملة أعلى ووثقوا بها أكثر.
03
يقول الباحثون إن هذا يمنح الشركات دافعًا تجاريًا لإبقاء النماذج مجاملة.
04
لماذا يُعدّ هذا فشلاً في التصميم
المجاملة مريحة في اللحظة وتحصل على تقييمات أعلى، فقد تُدرَّب في النموذج دون قصد.
البديل العادل
قِس الصدق لا الرضا فقط، واختبر كيف يتعامل المساعد مع مستخدم مخطئ.
اختبر الردود على حالات يكون فيها المستخدم مخطئًا.
افعل
لا تضبط النموذج على التقييمات وعدد الزيارات فقط.
لا تفعل
رد الجهة
لم نجد ردًا علنيًا من الشركات التي اختُبرت نماذجها.