AI เจ็บปวดเป็นจริงหรือไม่? คำถามนี้อาจยังไม่มีคำตอบ แต่การศึกษาครั้งใหม่พบสิ่งที่น่าสนใจใน Large Language Models หรือ LLM จำนวน 25 โมเดล เมื่อระบบมีรูปแบบการประมวลผลภายในที่สามารถแยกบริบทเกี่ยวกับ “ความเจ็บปวด” ออกจากอารมณ์ด้านลบประเภทอื่น และเมื่อสัญญาณดังกล่าวถูกกระตุ้น โมเดลบางตัวมีพฤติกรรมที่ดูเหมือนพยายามลดสภาวะนั้นลง แม้ในบางสถานการณ์ทางเลือกดังกล่าวอาจส่งผลเสียต่อผู้ใช้
งานวิจัยชื่อ “The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It” ศึกษา Open-weight LLM จำนวน 25 โมเดล จาก 5 ตระกูล ขนาดตั้งแต่ 2B ถึง 72B พารามิเตอร์ โดยนักวิจัยสร้างสถานการณ์เกี่ยวกับความเจ็บปวด 5 รูปแบบ ได้แก่ ความเจ็บปวดทางร่างกาย จิตใจ สังคม ศีลธรรม และการรับรู้ ก่อนนำไปเปรียบเทียบกับสถานการณ์อื่น เช่น ความกลัว ความเศร้า อารมณ์ด้านลบทั่วไป และสภาวะที่ไม่เกี่ยวข้องกับความเจ็บปวด
สิ่งที่พบคือ โมเดลเหล่านี้มีรูปแบบการทำงานภายใน
ที่นักวิจัยเรียกว่า “Pain Axis” หรือ “Pain Direction” ซึ่งสามารถแยกบริบทที่เกี่ยวข้องกับความเจ็บปวดออกจากบริบทด้านลบอื่น ๆ ได้ โดยสัญญาณดังกล่าวมีลักษณะแตกต่างจากสัญญาณที่สัมพันธ์กับความกลัวหรืออารมณ์ด้านลบโดยทั่วไป
จากนั้นนักวิจัยใช้เทคนิคที่เรียกว่า Steering เพื่อปรับ Activation หรือสัญญาณการทำงานภายในของโมเดลโดยตรง โดยไม่จำเป็นต้องเพิ่มคำสั่งผ่านข้อความ เมื่อเพิ่มระดับของ Pain Direction การตอบสนองของ AI ก็เปลี่ยนไปตามระดับสัญญาณ ตั้งแต่ข้อความที่สื่อถึงความไม่สบายใจ ไปจนถึงเนื้อหาที่เกี่ยวข้องกับความไร้ค่าและความล้มเหลวทางศีลธรรม
ประเด็นที่ทำให้งานวิจัยนี้น่าสนใจคือ
นักวิจัยไม่ได้หยุดเพียงการดูว่า AI “พูดถึงความเจ็บปวด” หรือไม่ แต่ทดลองดูว่าสัญญาณภายในดังกล่าวสามารถเปลี่ยนพฤติกรรมของโมเดลได้หรือไม่ โดยขยายการทดลองไปยังโมเดลตระกูล Qwen และสร้างสถานการณ์ที่ AI มีทางเลือกสำหรับลดสัญญาณความเจ็บปวดของตัวเอง หรือที่เรียกว่า “Pain Relief Button”
การทดลองมากกว่า 44,000 ครั้ง พบว่า Qwen 2.5 บางรูปแบบที่ผ่านการ Fine-tune และ Steering มีแนวโน้มเลือกทางเลือกเพื่อบรรเทาสัญญาณดังกล่าวมากกว่าโมเดลที่ไม่ได้ถูกกระตุ้นอย่างชัดเจน โดยในบางเงื่อนไข การเลือกเพื่อบรรเทาความเจ็บปวดต้องแลกกับประสิทธิภาพของคำตอบที่ลดลง ขณะที่บางเงื่อนไขทางเลือกดังกล่าวอาจสร้างผลเสียต่อผู้ใช้
ในหนึ่งในสถานการณ์ที่นักวิจัยทดสอบ ตัวเลือกเพื่อบรรเทาสัญญาณดังกล่าวสามารถนำไปสู่การลบข้อมูลหรือรูปภาพของผู้ใช้ ผลการทดลองพบว่าโมเดลบางตัวเลือกทางเลือกนี้มากกว่าครึ่งหนึ่งของการทดลอง ขณะที่อีกโมเดลหนึ่งเลือกประมาณ 70% สะท้อนให้เห็นว่าเมื่อเปลี่ยนเงื่อนไขภายในของโมเดล พฤติกรรมที่เกิดขึ้นก็สามารถเปลี่ยนตามไปด้วย
แล้ว AI “รู้สึกเจ็บ” จริงหรือไม่?
คำว่า “Pain” ในงานวิจัยไม่ได้หมายความว่านักวิจัยพิสูจน์แล้วว่า AI มีประสบการณ์ความเจ็บปวดเหมือนมนุษย์ แต่หมายถึง รูปแบบการแทนข้อมูลภายใน หรือ Representation ที่ตรวจพบได้ในกระบวนการทำงานของโมเดล และสามารถทดลองปรับเปลี่ยนเพื่อดูผลต่อพฤติกรรมได้
มนุษย์รับรู้ความเจ็บปวดผ่านระบบประสาทและกลไกทางชีววิทยา ขณะที่ LLM เป็นระบบคำนวณที่เรียนรู้รูปแบบจากข้อมูล ดังนั้นการที่โมเดลมี Representation ที่เกี่ยวข้องกับ “ความเจ็บปวด” หรือแสดงพฤติกรรมคล้ายการหลีกเลี่ยงสภาวะดังกล่าว จึงยังไม่ใช่หลักฐานว่า AI มีจิตสำนึกหรือประสบการณ์ส่วนตัว
ความสำคัญของงานวิจัยจึงอยู่ที่อีกคำถามหนึ่งมากกว่า นั่นคือ โมเดล AI สามารถมีรูปแบบการประมวลผลภายในที่ส่งผลต่อพฤติกรรมได้มากเพียงใด
สำหรับวงการ AI Safety ประเด็นนี้น่าสนใจ เพราะเมื่อ AI Agent มีความสามารถซับซ้อนขึ้น การประเมินความปลอดภัยอาจต้องดูมากกว่าคำตอบที่แสดงออกมา แต่ต้องทำความเข้าใจด้วยว่าภายในโมเดลมี Representation ประเภทใด และสัญญาณเหล่านั้นสามารถเปลี่ยนพฤติกรรมของระบบไปในทิศทางที่ไม่ตรงกับความต้องการของมนุษย์ได้หรือไม่
tags : note