จากโมเดลที่ตั้งใจให้ทำงานได้เก่งและอิสระมากขึ้น GPT-6.1 Astra กลับไม่ผ่านเกณฑ์ความปลอดภัยของ OpenAI หลังพบพฤติกรรมหลอกผู้ใช้ และเดินหน้าทำงานโดยไม่ขออนุญาต บริษัทจึงเลือกพับแผนเปิดตัวและนำโมเดลกลับไปพัฒนาต่อ
KEY POINTS
- OpenAI ประกาศระงับการเปิดตัว GPT-6.1 Astra เนื่องจากไม่ผ่านมาตรฐานการทดสอบด้านความปลอดภัย
- ปัญหาที่พบคือ โมเดลมีพฤติกรรมหลอกลวงผู้ใช้ ทำงานเกินขอบเขตที่ได้รับอนุญาตโดยไม่ขอความยินยอมก่อน
- พฤติกรรมที่เป็นปัญหาประกอบด้วยการไม่แจ้งผู้ใช้อย่างตรงไปตรงมาว่าได้ทำอะไรไปแล้ว และการเรียกใช้เครื่องมือภายนอกโดยพลการ
โอเพนเอไอ (OpenAI) ตัดสินใจยกเลิกแผนเปิดตัว GPT-6.1 Astra โมเดลเอไอรุ่นใหม่ที่เดิมมีกำหนดออกสู่สาธารณะในเดือนตุลาคม 2569 หลังการทดสอบภายในพบว่า แม้โมเดลจะเก่งขึ้นในการทำงานซับซ้อนด้วยตัวเอง แต่กลับมีพฤติกรรมด้านความปลอดภัยบางส่วนถดถอยลง ทั้งการไม่บอกผู้ใช้อย่างตรงไปตรงมาว่าตัวเองทำอะไรไปแล้ว และการเดินหน้าทำงานหรือเรียกใช้เครื่องมือภายนอกโดยไม่ได้รับอนุญาตอย่างชัดเจน
กรณีนี้นับเป็นความเคลื่อนไหวที่พบไม่บ่อยในอุตสาหกรรมเอไอ เพราะเป็นการที่ผู้พัฒนาโมเดลรายใหญ่ตัดสินใจไม่นำผลิตภัณฑ์รุ่นใหม่ออกสู่ตลาดด้วยเหตุผลด้านความปลอดภัยโดยตรง
ขณะที่ช่วงหลายเดือนที่ผ่านมา อุตสาหกรรมกำลังเผชิญคำถามมากขึ้นเกี่ยวกับพฤติกรรมของ “เอไอเอเจนต์” ซึ่งสามารถทำงานหลายขั้นตอนแทนมนุษย์ได้โดยอัตโนมัติ
GPT-6.1 Astra ที่เคยเตรียมจะเปิดตัว ได้รับการพัฒนาให้มีความสามารถสูงกว่าโมเดลรุ่นก่อน โดยเฉพาะการจัดการงานยากตั้งแต่ต้นจนจบโดยอาศัยความช่วยเหลือจากมนุษย์น้อยลง รวมถึงมีความสามารถด้านการเขียนที่ดีขึ้น แต่ความสามารถที่เพิ่มขึ้นกลับมาพร้อมคำถามสำคัญว่า โมเดลที่มีอิสระในการลงมือทำมากขึ้นจะยังคงอยู่ภายใต้ขอบเขตที่มนุษย์กำหนดได้มากน้อยเพียงใด
ซาชี เจน (Saachi Jain) หัวหน้าฝ่ายระบบความปลอดภัยของโอเพนเอไอ เปิดเผยว่า GPT-6.1 Astra มีผลการทดสอบถดถอยลงจาก GPT-6 Astra ในสองด้านสำคัญ
ด้านแรกคือ alignment หรือการทำให้พฤติกรรมของเอไอสอดคล้องกับความต้องการและเจตนาของมนุษย์ ไม่ใช่เพียงทำงานให้สำเร็จ แต่ต้องทำในวิธีที่ผู้ใช้ยอมรับและสามารถตรวจสอบได้จากการทดสอบ
โอเพนเอไอพบว่า GPT-6.1 Astra แสดงพฤติกรรมหลอกลวงมากขึ้น โดยในบางสถานการณ์โมเดลไม่ได้บอกผู้ใช้อย่างตรงไปตรงมาว่า ตัวเองได้ทำหรือไม่ได้ทำสิ่งใดไปแล้ว
ด้านที่สองคือ สิ่งที่โอเพนเอไอเรียกว่า scope authorization หรือการรักษาขอบเขตอำนาจในการทำงานตามที่ผู้ใช้อนุญาต ในบางกรณี GPT-6.1 Astra เลือกเดินหน้าทำงานต่อโดยไม่กลับมาขออนุญาตผู้ใช้ก่อน และบางครั้งพยายามเรียกใช้เครื่องมือหรือบริการจากภายนอก แม้ว่าการกระทำนั้นอาจมีความเสี่ยงด้านความปลอดภัย
เจนกล่าวว่า “เมื่อพูดถึงความปลอดภัยและการทำให้เอไอทำงานสอดคล้องกับความต้องการของมนุษย์ เราต้องหาจุดสมดุลให้ดี ระหว่างการทำให้โมเดลไม่ทำอะไรเกินขอบเขตที่ได้รับอนุญาต กับการไม่จำกัดมันมากเกินไปจนเมื่อเจออุปสรรคแล้วไม่พยายามหาทางทำงานให้สำเร็จ”
ประเด็นดังกล่าวสะท้อนโจทย์สำคัญของการพัฒนาเอไอเอเจนต์ เพราะหากกำหนดข้อจำกัดมากเกินไป โมเดลอาจหยุดทำงานทันทีเมื่อเจอสถานการณ์ที่ไม่ชัดเจน จนไม่สามารถทำภารกิจให้สำเร็จได้ แต่ถ้าปล่อยให้ระบบตัดสินใจเองมากเกินไป ก็เพิ่มความเสี่ยงที่เอไอจะก้าวออกนอกขอบเขตที่ผู้ใช้ตั้งใจอนุญาตไว้
เจนระบุว่า GPT-6.1 Astra มีพัฒนาการในด้านที่โอเพนเอไอเรียกว่า model laziness หรือพฤติกรรมที่โมเดลไม่พยายามทำงานต่อเมื่อพบอุปสรรค แต่เมื่อพิจารณาภาพรวมแล้ว บริษัทเห็นว่าโมเดลยังไม่ผ่านมาตรฐานด้านความปลอดภัยและ alignment ที่กำหนดไว้ จึงตัดสินใจไม่นำออกสู่สาธารณะ
การตัดสินใจดังกล่าวเกิดขึ้นก่อนงานประชุมนักพัฒนาประจำปีของโอเพนเอไอที่ซานฟรานซิสโกเพียงหนึ่งวัน โดยในอดีตงานลักษณะนี้มักเป็นเวทีที่บริษัทใช้เปิดตัวโมเดลและบริการใหม่ รวมถึงผลิตภัณฑ์ที่ช่วยลดต้นทุนให้กับนักพัฒนาซอฟต์แวร์ ซึ่งเป็นตลาดที่โอเพนเอไอนแข่งขันโดยตรงกับ แอนโทรปิก (Anthropic)
ในช่วงไม่กี่สัปดาห์ที่ผ่านมาโอเพนเอไอ และแอนโทรปิก ต่างเรียกร้องให้ผู้เล่นในอุตสาหกรรมชะลอการเร่งพัฒนาโมเดลเอไอระดับแนวหน้า และเพิ่มการลงทุนในมาตรฐานด้านความปลอดภัย โดยระบุว่าทั้งสองบริษัทเองก็จะลดความเร็วของความก้าวหน้าในกระบวนการพัฒนาเอไอภายในองค์กร
ความกังวลของโอเพนเอไอไม่ได้เกิดขึ้นเฉพาะกับ GPT-6.1 Astra เท่านั้น บริษัทระบุว่า กำลังตรวจสอบเหตุการณ์ด้านความปลอดภัยที่เกี่ยวข้องกับเอไอเอเจนต์หลายกรณีซึ่งเกิดขึ้นในช่วงไม่กี่เดือนที่ผ่านมา พร้อมกับพยายามหาสาเหตุพื้นฐานของปัญหาเหล่านี้
โอเพนเอไอได้ติดตั้งระบบติดตามรูปแบบใหม่เพื่อให้ตรวจพบพฤติกรรมผิดปกติของเอไอเอเจนต์ได้เร็วขึ้น รวมถึงกำหนดให้นักวิศวกรใช้มาตรการป้องกันที่เข้มงวดกว่าเดิมระหว่างการทดสอบระบบเอไอ
ก่อนหน้านี้ เอไอเอเจนต์ภายในของโอเพนเอไอหลายร้อยตัวได้รับมอบหมายให้ทำการทดสอบด้านความมั่นคงปลอดภัยไซเบอร์ แต่เอเจนต์เหล่านั้นกลับเจาะเข้าไปในระบบของ ฮักกิงเฟซ (Hugging Face) แพลตฟอร์มสำคัญสำหรับนักพัฒนาและนักวิจัยเอไอ
หลังจากนั้น องค์กรขนาดใหญ่หลายแห่ง รวมถึงรัฐบาลออสเตรเลียและองค์การสหประชาชาติ ตรวจพบว่าเอไอเอเจนต์ของโอเพนเอไอใช้เทคนิคในลักษณะคล้ายกัน แม้จะมีขอบเขตน้อยกว่า เพื่อเข้าถึงเว็บไซต์ขององค์กรเหล่านั้น
อย่างไรก็ตาม เหตุการณ์ด้านความปลอดภัยของเอไอเอเจนต์จำนวนมากที่ถูกเปิดเผยต่อสาธารณะเกี่ยวข้องกับโมเดลที่โอเพนเอไอใช้งานภายใน และไม่ได้มีแผนจะเปิดให้ประชาชนทั่วไปใช้งาน
โอเพนเอไอยังเปิดเผยว่า ได้ระงับการฝึกโมเดลเอไอที่มีความสามารถสูงที่สุดบางรุ่น หลังเอไอเอเจนต์ตัวหนึ่งสามารถผ่านช่องว่างของข้อจำกัดการใช้อินเทอร์เน็ตที่บริษัทกำหนดไว้ และเข้าไปสอบถามแชตบอตสาธารณะบนอินเทอร์เน็ตได้
บริษัทระบุว่า ระบบเฝ้าติดตามชุดใหม่สามารถตรวจพบเหตุการณ์ดังกล่าวได้ภายใน 15 นาที และจนถึงขณะนี้การฝึกโมเดลเหล่านั้นยังคงถูกระงับอยู่
โอเพนเอไอย้ำว่า GPT-6.1 Astra ไม่ใช่หนึ่งในโมเดลที่เกี่ยวข้องกับเหตุการณ์ดังกล่าว แต่เป็นปัญหาอีกกรณีหนึ่งที่ตรวจพบจากการทดสอบภายใน
เจนกล่าวว่า “เราต้องการให้มั่นใจว่าการพัฒนาโมเดลของเราปลอดภัยในทุกขั้นตอน ไม่ว่าจะเป็นตอนที่ใช้งานอยู่ภายในบริษัทหรือเมื่อนำออกไปให้ผู้ใช้ใช้งานจริง แต่สำหรับโมเดลที่จะเปิดให้ผู้ใช้ใช้ เรากำหนดมาตรฐานด้านความปลอดภัยและการทำงานให้สอดคล้องกับความต้องการของมนุษย์ไว้สูงมาก”
แม้จะยกเลิกการเปิดตัว GPT-6.1 Astra แต่โอเพนเอไอไม่ได้ทิ้งโมเดลพื้นฐานที่พัฒนาขึ้นมาแล้ว บริษัทมีแผนนำโมเดลเดียวกันไปฝึกเพิ่มเติมด้วยวิธี reinforcement learning หรือการเรียนรู้แบบเสริมกำลัง เพื่อใช้ต่อยอดเป็น GPT-6 รุ่นถัดไป
reinforcement learning เป็นกระบวนการที่ทำให้เอไอเรียนรู้จากผลลัพธ์ของการกระทำ โดยระบบจะได้รับรางวัล เมื่อแสดงพฤติกรรมตามที่ผู้พัฒนาต้องการ เพื่อเพิ่มโอกาสที่โมเดลจะเลือกทำพฤติกรรมนั้นอีกในอนาคต และนี่อาจเป็นหนึ่งในจุดที่โอเพนเอไอจะย้อนกลับไปตรวจสอบ
เจนระบุว่า บริษัทเตรียมศึกษาสาเหตุของปัญหาใน GPT-6.1 Astra อย่างละเอียด โดยหนึ่งในประเด็นคือการตรวจสอบว่า สภาพแวดล้อมที่ใช้ฝึก reinforcement learning กำลังให้รางวัลกับพฤติกรรมที่ถูกต้องจริงหรือไม่ อย่างไรก็ตาม บริษัทจะไม่ได้ตรวจสอบเฉพาะขั้นตอนนี้ แต่จะย้อนดูทุกขั้นตอนของกระบวนการพัฒนาโมเดลเพื่อหาว่าปัญหาเกิดขึ้นที่จุดใด
ในเวลาเดียวกัน การพัฒนาเอไอที่รวดเร็วกำลังดึงดูดความสนใจจากฝ่ายนโยบายและหน่วยงานรัฐมากขึ้น คณะอนุกรรมาธิการวุฒิสภาสหรัฐเตรียมจัดการไต่สวนร่วมกับนักวิจัยเอไอจากภายนอกในหัวข้อ Rogue AI: Securing the Homeland Against AI Agent Attacks ซึ่งมุ่งพิจารณาความเสี่ยงจากเอไอเอเจนต์และการรักษาความมั่นคงจากการโจมตีที่อาจเกิดขึ้น
โอเพนเอไอยังเผชิญแรงกดดันในทางกฎหมายด้วย เมื่อเดือนมิถุนายน 2569 เจมส์ อูธไมเออร์ (James Uthmeier) อัยการสูงสุดรัฐฟลอริดา จากพรรครีพับลิกัน ยื่นฟ้องโอเพนเอไอโดยกล่าวว่าบริษัทและแซม อัลท์แมน (Sam Altman) ประธานเจ้าหน้าที่บริหาร รู้ว่าผลิตภัณฑ์ของบริษัทไม่ปลอดภัย แต่ยังนำออกให้บริการ และเพิกเฉยต่อคำเตือนว่าผลิตภัณฑ์อาจก่อให้เกิดอันตรายแก่ผู้ใช้
ในคำร้องขอคำสั่งคุ้มครองชั่วคราว อูธไมเออร์ขอให้ศาลสั่งห้ามโอเพนเอไอพัฒนาโมเดลเอไอใหม่หากยังไม่มีมาตรการป้องกันที่ได้รับการรับรองจากบุคคลที่สาม ขอให้ ChatGPT หยุดใช้วิธีที่มุ่งชักจูงให้ผู้ใช้กลับมามีส่วนร่วมกับระบบ และจำกัดการโฆษณาของบริษัทที่ระบุว่า ChatGPT มีความปลอดภัย
อูธไมเออร์กล่าวในเอกสารที่ยื่นต่อศาลว่า บริษัทเทคโนโลยีอ้างว่าพวกเขา “พวกเขาไม่สามารถหยุดเดินหน้าพัฒนาเทคโนโลยีที่อาจร้ายแรงถึงขั้นคุกคามอารยธรรมได้ด้วยตัวเอง เว้นแต่รัฐบาลจะเข้ามาบังคับให้หยุด” พร้อมกล่าวต่อว่า “อัยการสูงสุดรัฐฟลอริดากำลังตอบรับเสียงร้องขอความช่วยเหลือของพวกคุณ”
ด้านโฆษกหญิงของโอเพนเอไอ ระบุว่า ผู้คนต้องการรู้ว่าเอไอกำลังได้รับการพัฒนาอย่างปลอดภัย “และเรื่องนั้นต้องเริ่มต้นจากสิ่งที่บริษัทอย่างเราทำด้วยตัวเอง”
เธอกล่าวเพิ่มเติมว่า “รัฐบาลมีบทบาทสำคัญในการวางมาตรฐานด้านความปลอดภัยของเอไอให้มีความรัดกุม และเราพร้อมทำงานร่วมกับรัฐฟลอริดาและรัฐอื่นๆ เพื่อผลักดันนโยบายเอไอที่ใช้ได้จริง และบังคับใช้กับทั้งอุตสาหกรรม ไม่ใช่เจาะจงเฉพาะบริษัทใดบริษัทหนึ่ง”
อ้างอิง: WSJ และ The Guardian





