การศึกษาใหม่ที่เผยแพร่โดย AI Disclosures Project ยกประเด็นคำถามสำคัญเกี่ยวกับ ความโปร่งใส และจริยธรรมของวิธีการฝึกอบรมที่ OpenAI ใช้ ที่ศูนย์กลางของการสอบสวนคือ GPT-4o ซึ่งเป็นโมเดลภาษาล่าสุดของบริษัทที่ถูกกล่าวหาว่ารับรู้และใช้เนื้อหาที่มีลิขสิทธิ์จากวัสดุที่เป็นความลับของผู้จัดพิมพ์ O’Reilly Media.
Summary
การวิจัยเพื่อเพิ่มความโปร่งใสในการแข่งขันด้านปัญญาประดิษฐ์
การศึกษาได้ดำเนินการในกรอบของโครงการ AI Disclosures Project ซึ่งเป็นโครงการที่นำโดยนักเทคโนโลยี Tim O’Reilly และนักเศรษฐศาสตร์ Ilan Strauss วัตถุประสงค์ของโครงการชัดเจน: ส่งเสริม ความรับผิดชอบ ที่มากขึ้นในภาคส่วนของปัญญาประดิษฐ์ โดยเน้นย้ำถึงความจำเป็นในการปฏิบัติที่โปร่งใสจากบริษัทที่พัฒนา LLM (Large Language Models)
เอกสาร, ซึ่งเป็น working paper, วิเคราะห์ว่าการขาดข้อบังคับอย่างเป็นทางการในปัจจุบันเกี่ยวกับการเปิดเผยข้อมูลที่ใช้ในการฝึกอบรมโมเดลเหล่านี้อาจสร้างปัญหาความไว้วางใจและความถูกต้องตามกฎหมายอย่างร้ายแรง นักวิจัยยืนยันว่า เช่นเดียวกับในตลาดการเงินที่มีกฎการเปิดเผยข้อมูลเพื่อส่งเสริมตลาดที่แข็งแกร่ง ในด้านของ AI ก็จำเป็นต้องมีการกำกับดูแลที่คล้ายกันเพื่อหลีกเลี่ยงการละเมิดและความเสียหายเชิงระบบ
OpenAI ทดสอบเนื้อหาที่มีลิขสิทธิ์: ข้อมูลพูดชัดเจน
เพื่อดำเนินการสอบสวนของพวกเขา นักวิจัยได้ใช้ชุดข้อมูลที่ได้รับมาอย่างถูกกฎหมายของ 34 libri protetti da copyright ที่ตีพิมพ์โดย O’Reilly Media ผ่านเทคนิคที่รู้จักกันในชื่อ DE-COP membership inference attack พวกเขาได้วัดว่ารูปแบบภาษาสามารถแยกแยะข้อความที่เขียนโดยมนุษย์จากเวอร์ชันที่ถูกถอดความโดย LLM ได้หรือไม่ ผลลัพธ์ชี้นิ้วไปที่ GPT-4o.
คะแนน AUROC (เมตริกที่วัดความสามารถของโมเดลในการแยกแยะสองคลาส) ชัดเจน:
- GPT-4o ได้รับคะแนน82% ในความสามารถในการจดจำเนื้อหาที่ไม่เปิดเผยจาก O’Reilly Media — ค่านี้บ่งชี้ถึงความเป็นไปได้สูงที่เนื้อหาเหล่านั้นจะถูกรวมอยู่ในข้อมูลการฝึกอบรม
- เพื่อเป็นการเปรียบเทียบ, โมเดล GPT-3.5 Turbo ได้แสดงให้เห็นถึงการรับรู้ที่อ่อนแอกว่ามาก (ประมาณ 50%), ในขณะที่ GPT-4o Mini, ซึ่งเป็นเวอร์ชันที่เบากว่าของโมเดล, ไม่ได้รู้จักเนื้อหาสาธารณะหรือไม่สาธารณะเลย
- ข้อมูลยังแสดงให้เห็นว่า GPT-4o สามารถจดจำวัสดุที่ไม่สามารถเข้าถึงได้สาธารณะ (82% AUROC) ได้ดีกว่าเนื้อหา O’Reilly ที่มีให้ใช้งานฟรี (64% AUROC)
- ในทางตรงกันข้าม, GPT-3.5 Turbo แสดงความคุ้นเคยมากขึ้นกับเนื้อหาสาธารณะ (64%) เมื่อเทียบกับเนื้อหาที่สงวนไว้ (54%).
แหล่งที่เป็นไปได้ในการเข้าถึงเนื้อหาที่มีลิขสิทธิ์, นักวิจัยแนะนำ, อาจเป็น LibGen, แพลตฟอร์มออนไลน์ที่มีชื่อเสียงซึ่งโฮสต์สำเนาดิจิทัลที่ไม่ได้รับอนุญาตของหนังสือที่ได้รับการคุ้มครองโดยลิขสิทธิ์. หนังสือทั้งหมดที่วิเคราะห์ในการศึกษานั้นมีอยู่ในห้องสมุดเสมือนนั้น.
อุตสาหกรรม AI ระหว่างความถูกต้องตามกฎหมาย เศรษฐกิจ และความยั่งยืนของเนื้อหา
ผลลัพธ์ทำให้เกิดคำถามที่กว้างขึ้น: การใช้ข้อมูลที่มีลิขสิทธิ์อย่างเป็นระบบเพื่อฝึกอบรมโมเดลภาษานั้นอาจทำลาย ความยั่งยืนทางเศรษฐกิจ ของมืออาชีพที่สร้างเนื้อหาต้นฉบับ หากบริษัทไม่ได้รับการชดเชยสำหรับการใช้สิ่งพิมพ์ของพวกเขา ระบบนิเวศของข้อมูลทั้งหมด — รวมถึงการพิมพ์ — เสี่ยงต่อการยากจนลง
ตามรายงาน การใช้ข้อมูลที่เป็นกรรมสิทธิ์โดยไม่ได้รับอนุญาตโดยไม่มีการชดเชย มีส่วนทำให้คุณภาพและความหลากหลายของเนื้อหาออนไลน์ลดลง และไม่ใช่เพียงแค่ประเด็นทางจริยธรรมเท่านั้น แต่ยังเป็นประเด็นทางเศรษฐกิจด้วย: หากไม่มีรายได้ สำนักพิมพ์และผู้สร้างมืออาชีพไม่สามารถผลิตเนื้อหาที่มีคุณค่าได้ต่อไป
ความกังวลของนักวิจัย: โมเดลรู้มากกว่าที่พวกเขาเปิดเผย
อีกแง่มุมหนึ่งที่การศึกษาชี้ให้เห็นคือการปรับปรุงความสามารถของ modelli linguistici più recenti ในการเข้าใจและสร้างความแตกต่างที่ละเอียดอ่อนระหว่างภาษามนุษย์และภาษาที่สร้างขึ้นโดยปัญญาประดิษฐ์ นอกจากนี้ นักวิจัยยังเน้นถึงความเป็นไปได้ของการมีอยู่ของ “bias temporale” เนื่องจากภาษามีการพัฒนาไปตามกาลเวลา เพื่อทำให้การบิดเบือนประเภทนี้เป็นกลาง การทดสอบได้ดำเนินการบนสองโมเดล (GPT-4o และ GPT-4o Mini) ที่ได้รับการฝึกฝนในช่วงเวลาเดียวกัน
แม้ว่าหลักฐานจะถูกจำกัดอยู่ในกรณีเฉพาะ — OpenAI e i testi O’Reilly — ผู้เขียนเชื่อว่าปรากฏการณ์นี้อาจแพร่หลายและ sistemico ในภาคส่วนของปัญญาประดิษฐ์เชิงสร้างสรรค์
สู่ตลาดที่ถูกกฎหมายสำหรับข้อมูลการฝึกอบรม?
การศึกษาเสร็จสิ้นด้วยการไตร่ตรองที่กว้างขึ้น: จำเป็นต้องสร้างระบบที่ นักพัฒนา AI สามารถเข้าถึง ข้อมูลสำหรับการฝึกอบรม ได้อย่างถูกกฎหมาย ผ่าน ข้อตกลงการอนุญาต และ ค่าตอบแทนที่โปร่งใส สำหรับผู้สร้างเนื้อหา
ธุรกิจบางแห่งกำลังพัฒนารูปแบบธุรกิจในทิศทางนี้แล้ว ตัวอย่างเช่น Defined.ai ซึ่งเป็นแพลตฟอร์มที่ขายข้อมูลสำหรับการฝึกอบรมโดยรับประกันความยินยอมของผู้เขียนและลบข้อมูลส่วนบุคคลที่สามารถระบุตัวตนได้ทั้งหมด อุตสาหกรรมที่มีการควบคุมอาจเป็นทางเลือกที่ถูกกฎหมายและยั่งยืนต่อพฤติกรรมที่ไม่โปร่งใสในปัจจุบันของบริษัทใหญ่บางแห่งในด้าน AI
บทบาทของการเมือง: ยุโรปสามารถเป็นผู้นำทาง
รายงานยังเสนอแนวทางด้านกฎระเบียบ: การมีผลบังคับใช้ของ AI Act dell’Unione Europea ใหม่ ซึ่งกำหนด obblighi di disclosure per l’addestramento dei modelli อาจกระตุ้นให้เกิดวงจรที่ดี หากกฎระเบียบถูกกำหนดไว้อย่างชัดเจนและถูกบังคับใช้อย่างแท้จริง เจ้าของสิทธิ์จะสามารถทราบได้ในที่สุดว่าเมื่อใดและอย่างไรที่ผลงานของพวกเขาถูกนำไปใช้
นี่จะเป็นก้าวสำคัญสำหรับการสร้าง mercati legali ที่เนื้อหาของผู้สร้างได้รับการยอมรับอย่างแท้จริงว่าเป็น beni economici ที่ใช้โดย IA.
ไม่ใช่แค่ OpenAI: การศึกษาใหม่ที่ชี้นิ้วไปที่การปฏิบัติที่พบมากขึ้นเรื่อยๆ
ผ่านการวิเคราะห์อย่างละเอียดของ 34 libri dell’editore O’Reilly Media นักวิจัยได้ให้ หลักฐานเชิงประจักษ์ ที่ชี้ให้เห็นว่า OpenAI อาจฝึกโมเดล GPT-4o ของตนเองด้วยข้อมูล ที่ไม่เปิดเผยต่อสาธารณะและมีลิขสิทธิ์ ด้วย
หากได้รับการยืนยัน นี่อาจเป็นการละเมิดที่ร้ายแรงไม่เพียงแต่กฎลิขสิทธิ์เท่านั้น แต่ยังรวมถึงหลักการของความโปร่งใส การยินยอม และ ความเป็นธรรม ที่บริษัทเทคโนโลยีขนาดใหญ่ควรปฏิบัติตามในยุคที่ปัญญาประดิษฐ์มีผลกระทบต่อสังคมและเศรษฐกิจของเรามากขึ้นเรื่อยๆ

