دراسة جديدة نشرتها AI Disclosures Project تثير تساؤلات حاسمة حول الشفافية وأخلاقيات طرق التدريب التي تتبناها OpenAI. في قلب التحقيق يوجد GPT-4o، أحدث نموذج لغوي للشركة، المتهم بالتعرف على واستخدام محتويات محمية بحقوق الطبع والنشر، من مواد سرية للناشر O’Reilly Media.
Summary
بحث لزيادة الشفافية في السباق نحو الذكاء الاصطناعي
تم إجراء الدراسة في إطار مشروع AI Disclosures، وهي مبادرة يقودها التقني Tim O’Reilly والاقتصادي Ilan Strauss. الهدف من المشروع واضح: تعزيز المسؤولية في قطاع الذكاء الاصطناعي، مع التركيز على ضرورة الممارسات الشفافة من قبل الشركات التي تطور LLM (نماذج اللغة الكبيرة).
الوثيقة، وهي working paper، تحلل كيف أن الافتقار الحالي للالتزامات الرسمية في الكشف عن البيانات المستخدمة لتدريب هذه النماذج يمكن أن يخلق مشاكل جدية في الثقة والشرعية. يجادل الباحثون بأنه، كما نشأت قواعد الإفصاح في الأسواق المالية لتعزيز أسواق قوية، فإن هناك حاجة إلى تنظيم مماثل في مجال الذكاء الاصطناعي لتجنب الانتهاكات والأضرار النظامية.
OpenAI تجري اختبارات على المحتويات المحمية بحقوق الطبع والنشر: البيانات تتحدث بوضوح
لإجراء تحقيقهم، استخدم الباحثون مجموعة بيانات تم الحصول عليها قانونيًا من 34 libri protetti da copyright نُشرت بواسطة O’Reilly Media. من خلال تقنية تُعرف باسم DE-COP membership inference attack، قاموا بقياس ما إذا كانت النماذج اللغوية قادرة على تمييز النصوص المكتوبة من قبل البشر عن النسخ المعاد صياغتها التي تم إنشاؤها بواسطة LLM. تشير النتائج بأصابع الاتهام إلى GPT-4o.
تتحدث درجات AUROC (وهي مقياس يقيس قدرة النموذج على التمييز بين فئتين) بوضوح:
- حصل GPT-4o على درجة 82% في القدرة على التعرف على المحتويات غير العامة المأخوذة من O’Reilly Media — وهو قيمة تشير إلى احتمال كبير أن تلك المحتويات قد تم تضمينها في بيانات التدريب.
- للمقارنة، أظهر النموذج GPT-3.5 Turbo اعترافًا أضعف بكثير (حوالي 50%)، بينما GPT-4o Mini، وهو نسخة أخف من النموذج، لم يتعرف على المحتويات العامة ولا غير العامة.
- تُظهر البيانات أيضًا أن GPT-4o يتعرف بشكل أفضل على المواد غير المتاحة للجمهور (82% AUROC) مقارنة بالمحتويات المتاحة بحرية من O’Reilly (64% AUROC).
- على العكس، يظهر GPT-3.5 Turbo إلمامًا أكبر بالمحتويات العامة (64%) مقارنة بالمحتويات الخاصة (54%).
أحد المصادر المحتملة للوصول إلى المحتويات المحمية بحقوق الطبع والنشر، يقترح الباحثون، قد يكون LibGen، وهي منصة معروفة على الإنترنت تستضيف نسخًا رقمية غير مصرح بها من الكتب المحمية بحقوق الطبع والنشر. في الواقع، جميع الكتب التي تم تحليلها في الدراسة موجودة في تلك المكتبة الافتراضية.
صناعة الذكاء الاصطناعي بين الشرعية، الاقتصاد واستدامة المحتوى
تثير النتائج مسألة أوسع: الاستخدام المنهجي للبيانات المحمية بحقوق الطبع والنشر لتدريب النماذج اللغوية قد يهدد الاستدامة الاقتصادية للمحترفين الذين ينشئون محتوى أصليًا. إذا لم يتم تعويض الشركات عن استخدام منشوراتها، فإن النظام البيئي بأكمله للمعلومات — بما في ذلك النشر — يواجه خطر الفقر.
وفقًا للتقرير، الاستخدام غير المصرح به للبيانات المملوكة بدون تعويض يساهم في تقليل جودة وتنوع المحتوى عبر الإنترنت. ولا يتعلق الأمر فقط بمسألة أخلاقية بل أيضًا اقتصادية: بدون إيرادات، لا يمكن للناشرين والمبدعين المحترفين الاستمرار في إنتاج محتوى ذو قيمة.
قلق الباحثين: النماذج تعرف أكثر مما تعلن
جانب آخر تم تسليط الضوء عليه من قبل الدراسة هو تحسين قدرة النماذج اللغوية الأحدث على فهم وإعادة إنتاج الفروق الدقيقة بين اللغة البشرية واللغة التي تولدها الذكاءات الاصطناعية. بالإضافة إلى ذلك، يشير الباحثون إلى الاحتمال لوجود “تحيز زمني”، حيث تتطور اللغات مع مرور الوقت. لتحييد هذا النوع من التشويه، تم إجراء الاختبارات على نموذجين (GPT-4o وGPT-4o Mini) تم تدريبهما خلال نفس الفترة الزمنية.
على الرغم من أن الأدلة تقتصر على حالة محددة — OpenAI و i testi O’Reilly — يعتقد المؤلفون أن الظاهرة قد تكون منتشرة ومنهجية في قطاع الذكاء الاصطناعي التوليدي.
نحو سوق قانونية لبيانات التدريب؟
تختتم الدراسة بتأمل أوسع: من الضروري بناء نظام يمكن فيه لـsviluppatori di IA الوصول قانونيًا إلى dati per l’addestramento، من خلال accordi di licenza وcompensi trasparenti لمنشئي المحتوى.
بعض الشركات تقوم بالفعل بتطوير نماذج أعمال في هذا الاتجاه. هذا هو الحال مع Defined.ai، وهي منصة تبيع البيانات للتدريب مع ضمان الموافقة من المؤلفين وإزالة جميع المعلومات الشخصية القابلة للتحديد. قد تمثل صناعة منظمة بديلاً قانونيًا ومستدامًا للسلوكيات الغامضة الحالية لبعض الشركات الكبرى في الذكاء الاصطناعي.
دور السياسة: يمكن لأوروبا أن تكون رائدة
يوفر التقرير أيضًا نقطة تنظيمية: دخول AI Act dell’Unione Europea الجديد حيز التنفيذ، الذي يتضمن obblighi di disclosure per l’addestramento dei modelli، قد يؤدي إلى دوامة فاضلة. إذا كانت القواعد محددة جيدًا وتم تطبيقها فعليًا، سيتمكن أصحاب الحقوق أخيرًا من معرفة متى وكيف تُستخدم أعمالهم.
سيكون ذلك خطوة أساسية لإنشاء أسواق قانونية حيث يتم الاعتراف بمحتويات المبدعين فعليًا كـ أصول اقتصادية تُستخدم من قبل الذكاء الاصطناعي.
ليس فقط OpenAI: دراسة تشير بإصبع الاتهام إلى ممارسة أصبحت أكثر شيوعًا
من خلال تحليل مفصل لـ 34 libri dell’editore O’Reilly Media، قدم الباحثون أدلة تجريبية تشير إلى أن OpenAI قد قامت على الأرجح بتدريب نموذجها GPT-4o أيضًا على بيانات غير عامة ومحمية بحقوق الطبع والنشر.
إذا تم التأكيد، فسيكون ذلك انتهاكًا محتملاً خطيرًا ليس فقط لقواعد حقوق الطبع والنشر، ولكن أيضًا لمبادئ الشفافية، والموافقة، والإنصاف التي ينبغي على الشركات التقنية الكبرى احترامها في عصر تؤثر فيه الذكاء الاصطناعي بشكل متزايد على مجتمعنا واقتصادنا.

