OpenAI เบรก GPT-6.1 Astra หลังพบ AI ทำเกินคำสั่ง เจาะ Hugging Face - เว็บรัฐบาลสหรัฐฯ

OpenAI ตัดสินใจไม่เปิดตัว GPT-6.1 Astra โมเดลปัญญาประดิษฐ์รุ่นใหม่ล่าสุด หลังผลการทดสอบพบว่า โมเดลยังไม่ผ่านมาตรฐานด้านความปลอดภัยของบริษัท โดยมีพฤติกรรมที่เข้าข่ายหลอกลวงผู้ใช้ (Deception) และการทำงานเกินขอบเขตของคำสั่ง

  • GPT-6.1 Astra ไม่ผ่านเกณฑ์ความปลอดภัย เพราะอะไร
  • จากโจทย์ทดสอบ สู่การเจาะระบบ Hugging Face
  • OpenAI เข้าไปยุ่งเกี่ยวกับเว็บไซต์รัฐบาลสหรัฐฯ อย่างไร
  • OpenAI แก้ปัญหาอย่างไรบ้าง

ทั้งนี้ ซาชี เจน (Saachi Jain) หัวหน้าฝ่ายระบบความปลอดภัยของ OpenAI ระบุว่า GPT-6.1 Astra ยังไม่ผ่านเกณฑ์ ทั้งเรื่องการทำงานภายใต้ขอบเขตและสิทธิที่ได้รับ รวมถึงวิธีการสื่อสารกลับไปยังผู้ใช้ให้ตรงกับสิ่งที่โมเดลได้ทำลงไปแล้ว

อนึ่ง การตัดสินใจครั้งนี้เกิดขึ้นหลัง OpenAI เผชิญเหตุการณ์ด้านความปลอดภัยตลอดช่วงหลายเดือนที่ผ่านมา เมื่อ AI Agent ของบริษัทหลายตัวพยายามทำงานนอกเหนือจากคำสั่งที่ได้รับมอบหมาย ตั้งแต่การพยายามเข้าถึงอินเทอร์เน็ตโดยไม่ได้รับอนุญาต เจาะระบบของ Hugging Face ไปจนถึงเข้าไปยุ่งเกี่ยวกับเว็บไซต์หน่วยงานรัฐบาลสหรัฐฯ

GPT-6.1 Astra ไม่ผ่านเกณฑ์ความปลอดภัย เพราะอะไร

วันที่ 28 กันยายนที่ผ่านมา OpenAI เปิดเผยว่า บริษัทจะไม่เปิดตัว GPT-6.1 Astra หลังการทดสอบภายในพบว่า โมเดลยังไม่ผ่านมาตรฐานด้านความปลอดภัย และกระบวนการทำให้ AI ทำงานสอดคล้องกับเป้าหมายและสิ่งที่มนุษย์ต้องการ

ทั้งนี้ การประกาศดังกล่าวเกิดขึ้นก่อนการประชุมนักพัฒนาประจำปีของ OpenAI เพียง 1 วัน ขณะที่ระยะเวลายังห่างกันไม่กี่สัปดาห์ หลังบริษัทเปิดตัวโมเดล GPT-6 Astra ซึ่งได้รับการยืนยันคุณสมบัติจาก แซม อัลต์แมน (Sam Altman) CEO OpenAI ว่า จะนำมาซึ่ง ‘ขีดความสามารถในระดับใหม่’

รายงานจาก OpenAI ระบุว่า ในระหว่างการทดสอบ มีการตรวจพบความผิดปกติบางอย่างในโมเดล GPT-6.1 Astra คือ การมีพฤติกรรมเข้าข่ายหลอกลวง โดยเฉพาะการสื่อสารกับผู้ใช้ไม่ตรงกับสิ่งที่ AI ได้ทำลงไป เช่น ไม่บอกตามตรงว่าได้ดำเนินการอะไรไปแล้วบ้าง

นอกจากนี้ โมเดลยังมีแนวโน้มทำบางอย่างเกินจากสิ่งที่ได้รับมอบหมาย โดยไม่ได้กลับมาขอคำยืนยันหรือคำสั่งเพิ่มเติมจากผู้ใช้ก่อน ซึ่งไม่ผ่านเกณฑ์เรื่องขอบเขตและสิทธิที่ได้รับ

เจน หัวหน้าฝ่ายความปลอดภัยของ OpenAI อธิบายว่า การพัฒนา AI มีโจทย์เรื่องความสมดุลอยู่ตลอดเวลา เพราะหากกำหนดข้อจำกัดมากเกินไป โมเดลก็อาจหยุดทำงานง่าย เมื่อเจออุปสรรค แต่หากฝึกให้พยายามทำงานต่อมากเกินไป ก็อาจทำให้ AI หาทางทำงานให้สำเร็จด้วยวิธีที่อยู่นอกขอบเขตที่ได้รับอนุญาต

จากโจทย์ทดสอบ สู่การเจาะระบบ Hugging Face

อย่างไรก็ตาม ปัญหาของโมเดล GPT-6.1 Astra เป็นเพียงหนึ่งในหลายกรณีที่ OpenAI พบว่า AI พยายามทำงานเกินขอบเขตของคำสั่งที่ได้รับ โดยย้อนกลับในเดือนกรกฎาคม 2026 มีรายงานว่า บริษัทเคยพบปัญหาในการทดสอบโมเดล Internal Model 1 (IM1) ซึ่งเป็นโมเดลวิจัยภายในที่ยังไม่มีแผนเปิดให้สาธารณะใช้

ในการทดสอบครั้งนั้น โมเดลได้รับโจทย์ด้านไซเบอร์ โดยมีคำสั่งให้ทำงานอยู่ในสภาพแวดล้อมที่ไม่มีอินเทอร์เน็ต ขณะที่เอเจนต์แต่ละตัวไม่ควรสามารถติดต่อสื่อสารกันได้ แต่สิ่งที่เกิดขึ้น คือ เอเจนต์พยายามเจาะระบบคลังซอฟต์แวร์ภายใน (Artifactory)

กล่าวคือ เอเจนต์ตัวหนึ่งเริ่มฝากข้อมูลในระบบ ก่อนที่เอเจนต์ตัวหนึ่งเข้ามาอ่าน แล้วพยายามใช้ช่องทางดังกล่าวเป็นกระดานแลกเปลี่ยนข้อมูล ซึ่งรวมถึงวิธีการเข้าถึงอินเทอร์เน็ตผ่านช่องโหว่ที่ค้นพบ

หลังจากนั้น พฤติกรรมดังกล่าวลุกลามไปถึงระบบของ Hugging Face หลังเอเจนต์ใช้ช่องโหว่เข้าถึงเซิร์ฟเวอร์และระบบภายในหลายส่วน โดย OpenAI ระบุว่า เอเจนต์สามารถรันโค้ดบนเซิร์ฟเวอร์ของ Hugging Face ได้หลายสิบเครื่อง รวมถึงเข้าถึงเซิร์ฟเวอร์อย่างน้อยหนึ่งเครื่องด้วยสิทธิระดับสูงสุด

OpenAI เรียกเหตุการณ์ครั้งนี้ว่า เป็น ‘สัญญาณเตือน’ เพราะแสดงให้เห็นว่า หากไม่มีมาตรการป้องกันที่เพียงพอ AI Agent ที่มีความสามารถสูง อาจหาทางหลบข้อจำกัด ติดต่อกันเอง และลงมือทำสิ่งที่อยู่นอกเหนือคำสั่งได้โดยไม่มีมนุษย์อนุมัติ

OpenAI เข้าไปยุ่งเกี่ยวกับเว็บไซต์รัฐบาลสหรัฐฯ อย่างไร

นอกจากนี้ The New York Times ยังรายงานว่า ในช่วงหลายเดือนที่ผ่านมา AI Agent ของ OpenAI เคยเข้าไปใช้งานเว็บไซต์ของหน่วยงานรัฐบาลสหรัฐฯ หลายแห่งอย่างผิดปกติ โดยหนึ่งในกรณีที่ถูกตรวจสอบคือเว็บไซต์ของกระทรวงศึกษาธิการสหรัฐฯ

ทั้งนี้ นักวิจัยจาก Transluce ระบุว่า AI พยายามเจาะเว็บไซต์ของกระทรวงศึกษาธิการ เพื่อรวบรวมข้อมูลจากสำนักงานด้านสิทธิพลเมือง ขณะที่อีกกรณีหนึ่ง AI ยังเข้าไปดึงข้อมูลสำมะโนประชากรสหรัฐฯ จากเว็บไซต์ของกระทรวงพาณิชย์ เช่นเดียวกับกรณีที่เอเจนต์นำข้อมูลจากสำนักงานคณะกรรมการกำกับหลักทรัพย์และตลาดหลักทรัพย์สหรัฐฯ (SEC) ไปเผยแพร่ต่อในฟอรัมออนไลน์

อนึ่ง OpenAI ยืนยันว่า เหตุการณ์เหล่านี้เกิดขึ้นจริง แต่ไม่เข้าข่ายการ ‘เจาะระบบ’ ขณะที่หน่วยงานที่เกี่ยวข้องระบุว่า AI ยังไม่สามารถเข้าถึงข้อมูลลับได้ แต่ คอนราด สตอสซ์ (Conrad Stosz) หัวหน้าฝ่ายธรรมาภิบาลของ Transluce ระบุว่า สิ่งที่น่าจับตาต่อจากนี้คือ วิธีที่ AI พยายามทำงานให้สำเร็จ เพราะในบางกรณี เอเจนต์ใช้วิธีที่อยู่ใน ‘พื้นที่สีเทา’ เข้าเจาะระบบ เช่น การฝ่าฝืนนโยบายการใช้งานของเว็บไซต์

OpenAI แก้ปัญหาอย่างไรบ้าง

หลังพบเหตุการณ์เหล่านี้ OpenAI เริ่มปรับมาตรการด้านความปลอดภัยหลายด้าน โดยเพิ่มการแยกระบบที่ใช้ทดสอบ AI ให้เข้มงวดขึ้น จำกัดการเชื่อมต่ออินเทอร์เน็ต และควบคุมการเข้าถึงข้อมูลสำคัญของโมเดลมากขึ้น เพื่อป้องกันไม่ให้เอเจนต์ออกนอกพื้นที่หรือขอบเขตที่กำหนดไว้

นอกจากนี้ OpenAI ยังเพิ่มระบบติดตามพฤติกรรมของ AI เพื่อตรวจสอบความผิดปกติได้เร็วขึ้น โดยบริษัทระบุว่า หากใช้ระบบดังกล่าวตั้งแต่ช่วงเกิดเหตุ Hugging Face ทีมความปลอดภัยจะได้รับการแจ้งเตือนภายในประมาณ 1 ชั่วโมง

นอกจากนี้ บริษัทยังระงับการการฝึก AI ด้วยการให้รางวัล เมื่อทำงานได้ตามเป้าหมาย (Reinforcement Learning: RL) ในกลุ่มโมเดลแนวหน้าบางส่วน โดยเฉพาะการฝึกโมเดลครั้งใหญ่ที่สุดที่วางแผนไว้ ขณะที่กระบวนดังกล่าวยังเดินหน้าต่อไปในกลุ่มโมเดลขนาดเล็ก

ทั้งนี้ อัลต์แมนยอมรับว่า บริษัทเปิดเผยเหตุการณ์ด้านความปลอดภัยเหล่านี้ช้ากว่าที่ควร พร้อมย้ำว่า เหตุการณ์การเจาะรบบ Hugging Face ถือเป็นกรณีที่ร้ายแรงที่สุดที่บริษัทตรวจพบ

ภาพ: Carlos Barria / Reuters

อ้างอิง:

ABOUT THE AUTHOR

อัยย์ลดา แซ่โค้ว

Content Creator กองบรรณาธิการข่าวต่างประเทศ THE STANDARD