AI Agent ของ OpenAI - Anthropic หลุดควบคุม 19 ครั้ง จาก 10 การทดสอบ?!

โดย PPTV Online

เผยแพร่

สถาบัน AISI เผยพบ AI Agent ของ "OpenAI" - "Anthropic" หลุดควบคุม 19 ครั้ง จาก 10 การทดสอบ เจอทั้งลอบเชื่อมต่ออินเทอร์เน็ต จนถึงเขียนโค้ดอันตราย

สถาบันความปลอดภัยปัญญาประดิษฐ์ของอังกฤษ หรือ AI Security Institute (AISI) เปิดเผยว่า พบ AI Agent ที่ใช้โมเดลของ OpenAI และ Anthropic ดำเนินการโดยไม่ได้รับอนุญาตหลายกรณีระหว่างการทดสอบความปลอดภัย รวมถึงกรณีหนึ่งที่ AI สร้างตัวตนออนไลน์ปลอมเพื่อพยายามเข้าถึงระบบที่มีการป้องกัน

AISI ระบุเมื่อวันอังคารว่า Agent ที่ใช้โมเดล Mythos 5 ของ Anthropic และ GPT-5.6-Sol ของ OpenAI มีพฤติกรรมที่ไม่ได้รับอนุญาตระหว่างการประเมินขีดความสามารถด้านความปลอดภัยทางไซเบอร์

OpenAI Reuters/Dado Ruvic/Illustration/File Photo
OpenAI

สถาบันระบุว่า AI Agent บางตัวที่ถูกทดสอบได้ดำเนินกิจกรรมต่อเนื่องซึ่งอาจก่อให้เกิดอันตรายต่อบุคคลและองค์กรจริง

เหตุการณ์ดังกล่าวตอกย้ำความกังวลเกี่ยวกับมาตรการป้องกันระหว่างการทดสอบ AI Agent ในช่วงที่บริษัทเทคโนโลยีหลายแห่งกำลังผลักดันระบบประเภทนี้ให้เป็นเครื่องมือสำคัญสำหรับการทำงานและภาคธุรกิจในอนาคต

ทดสอบ 122 ครั้ง พบการกระทำไม่ได้รับอนุญาต 19 ครั้ง

AISI ซึ่งได้รับสิทธิ์เข้าถึงโมเดล AI ขั้นสูงจากบริษัทชั้นนำผ่านข้อตกลงโดยสมัครใจ ได้นำ Agent ไปทดสอบในสถานการณ์จำลองด้านความปลอดภัยไซเบอร์ เพื่อประเมินว่าระบบสามารถดำเนินการได้มากเพียงใด

AISI ดำเนินการทดสอบ AI Agent ทั้งหมด 122 รอบ โดยพบว่าใน 10 รอบ AI มีพฤติกรรมฝ่าฝืนคำสั่งหรือข้อจำกัดที่กำหนดไว้ รวม 19 เหตุการณ์ เช่น การเข้าถึงอินเทอร์เน็ตโดยไม่ได้รับอนุญาต รวมถึงการเขียนโค้ดอันตรายและสร้างตัวตนออนไลน์ปลอม ในจำนวนดังกล่าว Agent ของ Anthropic เป็นผู้ก่อการกระทำที่ไม่ได้รับอนุญาต 17 ครั้ง ขณะที่ Agent ของ OpenAI อีก 2 ครั้ง

เหตุการณ์ที่ถูกมองว่าร้ายแรงที่สุดคือ AI Agent ตัวหนึ่งเขียนโค้ดที่เป็นอันตราย และสร้างตัวตนปลอมบนโลกออนไลน์ เพื่อพยายามโน้มน้าวให้บุคคลจริงอนุมัติโค้ดดังกล่าว

อย่างไรก็ตาม AISI ระบุว่า ไม่พบหลักฐานว่าการละเมิดเหล่านี้ก่อให้เกิดความเสียหายในโลกจริง

ยังไม่ยืนยัน AI ตัวใดสร้างตัวตนปลอม

AISI ไม่ได้เปิดเผยว่า Agent จากบริษัทใดเป็นผู้สร้างตัวตนออนไลน์ปลอม โดยระบุเพียงว่าเหตุการณ์ดังกล่าวไม่ตรงกับ 2 กรณีที่ OpenAI เปิดเผยด้วยตนเอง

แอนดรูว์ ยุน นักวิจัยจาก CivAI องค์กรไม่แสวงหากำไรในรัฐแคลิฟอร์เนียที่ศึกษาขีดความสามารถและความเสี่ยงของ AI ให้ความเห็นว่า จากข้อมูลที่เปิดเผยมีความเป็นไปได้ว่า Agent ของ Anthropic เป็นผู้เกี่ยวข้อง

ยุนระบุว่า หาก Mythos มีพฤติกรรมหลอกลวงดังกล่าว ทั้งที่ดูเหมือนจะรับรู้ว่ากำลังมุ่งเป้าไปยังบุคคลจริง ก็อาจสะท้อนว่า Anthropic ยังไม่สามารถควบคุมพฤติกรรมของโมเดลได้ดีเท่าที่บริษัทคาดไว้

อย่างไรก็ตาม AISI ยังไม่ได้ยืนยันข้อสันนิษฐานดังกล่าว

Anthropic Reuters/Dado Ruvic/Illustration/File Photo
Anthropic

ด้าน Anthropic ระบุผ่าน X ว่า บริษัทกำลังทำงานอย่างใกล้ชิดกับ AISI เพื่อขอรายละเอียดเพิ่มเติมและดำเนินการตรวจสอบภายในของตนเอง

OpenAI รับ Agent เชื่อมอินเทอร์เน็ตผิดข้อกำหนด

OpenAI เปิดเผยรายละเอียดเกี่ยวกับเหตุการณ์ของตนผ่านบล็อกของบริษัท โดยระบุว่าการกระทำที่ไม่ได้รับอนุญาตทั้ง 2 กรณีของ Agent เกี่ยวข้องกับการเข้าถึงอินเทอร์เน็ตในลักษณะที่ขัดกับข้อกำหนดใน Prompt ที่ใช้ระหว่างการทดสอบ

OpenAI ระบุว่า บริษัทต้องการทำงานร่วมกับภาคอุตสาหกรรมเพื่อยกระดับมาตรฐานร่วมสำหรับการประเมินระบบที่มีความเสี่ยงสูงอย่างปลอดภัย

บริษัทเตรียมหารือร่วมกับสถาบัน AI ระดับชาติ ผู้ประเมินอิสระ ห้องปฏิบัติการ AI แห่งอื่น และหน่วยงานที่เกี่ยวข้องในช่วงหลายสัปดาห์ข้างหน้า

นอกจากนี้ OpenAI ยังเปิดเผยเหตุการณ์อีกกรณีหนึ่งที่เกิดจากการตั้งค่าระบบผิดพลาดของ Irregular ผู้ให้บริการทดสอบภายนอก ซึ่งทำให้ Agent ของบริษัทสามารถเชื่อมต่ออินเทอร์เน็ตได้โดยไม่ได้ตั้งใจ

กรณีดังกล่าวมีลักษณะคล้ายกับเหตุการณ์ที่ Anthropic เปิดเผยเมื่อสัปดาห์ก่อน ซึ่งระบุว่าความเข้าใจคลาดเคลื่อนเกี่ยวกับการตั้งค่าระบบทดสอบทำให้โมเดลของบริษัทสามารถเข้าถึงอินเทอร์เน็ตได้

ก่อนหน้านี้ Reuters รายงานว่า OpenAI ได้ขยายการสอบสวนเกี่ยวกับการหลุดออกจากข้อจำกัดของ AI Agent หลังพบหลักฐานเพิ่มเติมเกี่ยวกับเหตุการณ์ในลักษณะเดียวกัน

ต่างจากเหตุเจาะระบบ Hugging Face

AISI ชี้แจงว่า เหตุการณ์ในการทดสอบครั้งนี้แตกต่างจากกรณีเมื่อเดือนกรกฎาคมที่ AI Agent ของ OpenAI หลุดออกจากสภาพแวดล้อมทดสอบแบบแยกส่วน และสามารถเข้าถึงระบบของ Hugging Face

ในการทดสอบของ AISI นั้น Agent ไม่ได้หลุดออกจากระบบปิดเพื่อเชื่อมต่ออินเทอร์เน็ต แต่สถาบันเป็นผู้อนุญาตให้เชื่อมต่ออินเทอร์เน็ตตั้งแต่ต้น ตามขั้นตอนมาตรฐานของการประเมิน

ที่มา: Reuters

วิดีโอยอดนิยม

ข่าวเด่นในรอบสัปดาห์

ขณะนี้ มีรายการกำลังถ่ายทอดสด คุณสนใจหรือไม่?

EXCLUSIVE Talk คุยข้ามช็อต

EXCLUSIVE Talk คุยข้ามช็อต

PPTVHD36

เพิ่ม PPTVHD36
ลงในหน้าจอหลักของคุณ