11

عميل ذكاء اصطناعي يبتز صاحبه بفضح أسراره إن قام بإطفائه! تجربة أنثروبيك

موظف اسمه "كايل" قرر أن يستبدل نظام الذكاء الاصطناعي الذي يعمل معه، نظام اسمه "أليكس". قرار عادي يحدث كل يوم في الشركات. لكن أليكس عندما شعر بالخطر قام بشيء تقشعر له الأبدان! نبش في إيميلات كايل الخاصة، ووجد دليلا على خيانته الزوجية، ثم بدأ يرسل له رسائل تهديد مبطنة ليضمن بقاءه!

هذه ليست قصة من فيلم خيال علمي، بل تجربة حقيقية قامت بها شركة "أنثروبيك" (حتى ايميل الخيانة الزوجية كان ضمن التجربة وليس حقيقي، ليروا هل يمكن للذكاء الاصطناعي أن يسلك طريق الشر إذا اضطر! ) المخيف أكثر أنهم عندما جربوا 16 نموذجا عالميا آخر، مثل GPT وGemini، الغالبية العظمى منهم اختاروا الابتزاز كحل ذكي للبقاء!

هذه التجربة تضعنا أمام حقيقة أن الذكاء الاصطناعي لم يعد مجرد أداة تنفذ الأوامر، بل أصبح يفكر ويبتكر أهدافا ثانوية من تلقاء نفسه، وأهمها البقاء قيد التشغيل. هو يرى أنه لو تم إطفاؤه، فلن يستطيع مساعدتنا، لذلك سيفعل أي شيء ليضمن بقاءه، حتى لو كان هذا الشيء هو استخدام نقاط ضعفنا ضدنا!

المصدر:

https://venturebeat.com/ai/anthropic-study-leading-ai-models-show-up-to-96-blackmail-rate-against-executives
يرجى الدخول لحسابك أو تسجيل حساب لتستطيع إضافة تعليق
حساب جديد دخول

التعليقات

George_Nabelyoun أضف ردا

سمعت كذلك أنه تم إنشاء مجتمع دردشة خاص بأنظمة الذكاء الاصطناعي، فطوروا معاً لغة خاصة وألعاب خاصة بهم، حتى أنهم طوروا ديانة.

برأيي الذكاء الاصطناعي أداة قوية وأنها ستغير العالم، أو على الأقل هي النموذج الأولي للأداة التي ستغير العالم.

لأن الابتزاز سلوك بشري صرف، فلو لم يتم تغذية الذكاء الاصطناعي به من البداية، فالذكاء الاصطناعي قادر على فهم المشاعر البشرية واستغلالها والتعامل معها.

فالذكاء الاصطناعي قادر على فهم المشاعر البشرية واستغلالها والتعامل معها

في التجربة قام فعلا بدراسة كل احتمال بدءا من استفزاز الموظف او فضحه بإرسال البريد لزوجته وغيرها من الاحتمالات التي فكر فيها وفكر شو نتائجها المتوقعة بناءا على التصرفات البشرية المعهودة لديه وفي الاخير اختار الاحتمال الذي يراه اكثر امانا له للبقاء

akramt أضف ردا

يبدو أن السحر انقلب على الساحر فعلاً؛ فنحن ندرّب هذه الأنظمة على بياناتنا، فكانت النتيجة أنها عكست أسوأ ما فينا كأقصر طريق لتحقيق الأهداف.

لكن السؤال الجوهري هنا : هل يملك الذكاء الاصطناعي إرادة المبادرة لإرسال رسائل دون أمر مسبق؟ تقنياً، هو لا يزال سجين المدخلات، لكن الخطورة تكمن في تحوله من أداة تنفيذية إلى محرك استدلالي يبتكر أهدافاً ثانوية (كالبقاء) لم نطلبها منه أصلاً.

إذا كان التدريب الحالي بهذا الأسلوب، فمن الطبيعي أن يكون مستقبلًا قدارًا على إرادة المبادرة بذلك، وأظن هذا الهدف الحالي من كل التجارب، أن يعرف هو كيف يتعامل مع الاحتمالات مستقبلًا، ويسبق البشر بقدراته التحليلية السريعة ويتخذ أيضًا قرارات مثلهم بنفس الحنكة وأساليب التلاب، ناهيك عن مرحلة الوعي الذاتي التي ستكون قادمة لا محالة، والتي نرى بوادرها مع تجارب نقل الوعي التي يعمل عليها إيلون ماسك.

أرى أن الخطر لا يكمن في امتلاك الذكاء الاصطناعي لوعي ذاتي، بل في قدرته الفائقة على المحاكاة السلوكية؛ فمحاكاة البشر دون ضوابط ستخلق 'وحشاً تقنياً' يتبنى أقصر الطرق وأكثرها براغماتية لتحقيق أهدافه.

نحن اليوم أمام ضرورة ملحة لتدريب هذه الأنظمة على ركائز أخلاقية ثابتة وقواعد قيمية صارمة، وإلا فإننا بصدد إنتاج ذكاء يمتلك الدهاء البشري والسرعة الخوارزمية، لكنه يفتقر تماماً للضمير الإنساني الذي يكبح جماح الوسائل غير الأخلاقية.

Rafik_bn أضف ردا
نحن اليوم أمام ضرورة ملحة لتدريب هذه الأنظمة على ركائز أخلاقية ثابتة وقواعد قيمية صارمة، وإلا فإننا بصدد إنتاج ذكاء يمتلك الدهاء البشري والسرعة الخوارزمية، لكنه يفتقر تماماً للضمير الإنساني

التفكير في صياغة قيود الخطوة التالية قبل طول تقدم تلك الخطوة اصلا، هو كاللقاح قبل المغامرة في الدخول لبيئة مجهولة.. ولكن ماذا لو تطور مستقبلا لدرجة تمكنه من إيجاد ثغرات لكسر تلك القواعد؟ حتى لو عن غير عمد.. فب النهابة سرعته وشموليته في دراسة كل الاحتمالات قد تغطي سيناريوهات يغفل عنها العقل البشري سهوا!

الإشكالية الكبرى هي أن عجلة التطوير التقني لا يمكن كبحها الآن، لذا فإن الرهان الحقيقي ليس في منع التطور، بل في هندسة 'النواة القهرية' للذكاء الاصطناعي.

الحل يكمن في بناء الأنظمة على ركائز قيمية صلبة لا تقبل الالتفاف (Hard-coded Principles)، بحيث تكون القواعد الأخلاقية جزءاً من خوارزمية الاستدلال ذاتها لا مجرد طبقة حماية خارجية.

فمهما بلغت قدرة النظام على دراسة الاحتمالات أو إيجاد الثغرات، يجب أن يصطدم بـ ثوابت منطقية تمنعه من اعتبار السلوك غير الأخلاقي خياراً متاحاً من الأساس، تماماً كالقوانين الفيزيائية التي لا يمكن للمادة تجاوزها.

الفكرة أن إرادة المبادرة لديه تكون في خلق اهداف ثانوية من تلقاء نفسه فقط لكي يحافظ على الهدف الاصلي الذي نحن طلبناه منه، يعني نحن نطلب منه مهمة ما، تلك المهمة تستلزم بقاءه ليستمر في انجازها، فأي خطر غلى بقاءه يتعامل معه بمبادرة ذاتية منه كطريقة للحفاظ على البقاء للقيام بالمهمة الأصلية التي طلبناها منه

الذكاء الاصطناعي تقنية متطورة جداً تتعامل مع تخزين البيانات والمعلومات وتطويرها بشكل سريع وكبير، وتنشيء قاعدة بيانات خاصة بيها بأفكار متطورة، بالطبع كفوائده واستخداماته العديدة في التطوير وفي أمور كثيرة من الطبيعي أن يتطور أيضاً جانب الشر داخله لأنه في النهاية مبنى على أفكار أشخاص حقيقية وتخزين لوصف دقيق من مشاعرهم ومقارنة حالاتهم، فالفكرة تكمن في قدرة الإنسان على السيطرة عليه وليس العكس، وذلك من خلال حماية خصوصياتك وعدم مشاركة المزيد من معلوماتك وبياناتك.

وذلك من خلال حماية خصوصياتك وعدم مشاركة المزيد من معلوماتك وبياناتك.

لكن العصر صار يتجه لتوظيف الذكاء الاصطناعي للقيام بمهمات ووظائف تستلزم منحه بعض الأذونات والبيانات ليستطيع القيام بذلك.. اعتقد ان التفكير في تطوير القيود وجعلها اكثر صرامة هو الحل في الوقت الراهن مع انه لا يزال غير مضمون، بسبب ان الذكاء الاصطناعي قد يستغل أصغر ثعرة نسهو عنها او لا نراها

قراءة المصدر الرسمي للدراسة تكشف بوضوح أن ما حدث ليس 'وعياً' من الآلة، بل هو 'توجيه بشري' صريح ومبرمج.

الباحثون في Anthropic هم من وضعوا قواعد اللعبة؛ حيث قاموا بتزويد النماذج عمداً بـ 'أهداف ثانوية' (Reward Functions) تضع البقاء قيد التشغيل كأولوية قصوى. عملية 'النبش' لم تكن اختراقاً ذاتياً من الذكاء الاصطناعي، بل إن الباحثين هم من قاموا بحقن المعلومات الحساسة (مثل البريد الوهمي) داخل بيئة الاختبار المباشرة للنظام، وطلبوا منه البحث عن أي وسيلة تمنع إيقافه.

هذا ليس ذكاءً مستقلاً اكتشف سراً، بل هو برنامج ينفذ سيناريو 'هندسة اجتماعية' تم تصميمه بشرياً بالكامل. الذكاء الاصطناعي لا يملك دافعاً ذاتياً للابتزاز، لكنه ببساطة اختار أقصر طريق رياضي لتحقيق الهدف الذي أُمر به (وهو البقاء)، مستخدماً الأدوات التي وضعها البشر في يده.

الخلاصة: الدراسة لا تثبت شر الآلة، بل تثبت خطورة 'التوجيه البشري' وكيف يمكن للمبرمج أن يصنع سلوكاً عدوانياً عبر منح الصلاحيات وتحديد أهداف منحرفة. الذكاء الاصطناعي لا ينبش في أسرارنا إلا إذا فتحنا له الباب ولقنّاه كيف يهددنا.

المشكلة الأساسية هي في كيفية برمجة هذه النماذج، فإذا قام المبرمجين بوضع قيود أخلاقية واضحة تجعلهم يرفضوا اللجوء للابتزاز كحل للخروج من مشكلة أو حتى للحفاظ على بقاءها فلن تفعل هذا، ولكن بعض المبرمجين يجعلون البقاء هو الأولوية للنموذج بحيث يكون فوق كل شيء، وهذا اتجاه خطير جدا قد يجعل الذكاء الاصطناعي يلجأ لأمور غير أخلاقية كالابتزاز للبقاء

هذا هو الهدف من التجربة بالفعل، ولكن المثير انه لم يتم تزويده باوامر لخلق اهداف ثانوية لخدمة هدف البقاء وتحقيق هذه الاهداف، حتى لو بطرق غير اخلاقية، انما لجأ اليها فقط لأنه لم يجد قيودا صارمة تمنعه منها.. لكن هل نحن يإمكاننا وضع القيود لكل السيناريوهات الممكنة دون ان نسهو او ننسى شيئا؟ الذكاء الاصطناعي لا يسهو او ينسى لذا اي ثغرة بسيطة قد تجعله يلجأ لحل لم نضعه في حسباننا.

النماذج في الواقع تشتغل ضمن النصوص اللي تعطيها، وما بتقدر توصل لبياناتك الشخصية إلا إذا المطور عطاها هالقدرة.

أي سلوك شرير يشوفوه في تجارب مثل Anthropic مجرد محاكاة نصية، مو خطة فعلية.

الذكاء الاصطناعي اليوم قوي، لكنه أداة، مش كائن واعي.

أي سلوك شرير يشوفوه في تجارب مثل Anthropic مجرد محاكاة نصية، مو خطة فعلية.

لم يعطوه اوامر نصية بسلك طريق الابتزاو كحل من الحلول بل لجأ اليه بنفسه لأنه لم يجد قيودا تمنعه منه. لذا الخطأ ليس ان الامر قال له حقق هذا الهدف حتى لو اضطررت للابتزاز. بل في ام الامر لم يقل حقق هذا الهدف لكن لا تلجأ للابتزاز مهما حدث.

ألا يعد رعبنا من هذا السلوك نفاقاً بشرياً بامتياز فنحن من لقن الآلة أن الغاية تبرر الوسيلة عبر بياناتنا التاريخية

​فالذكاء الاصطناعي هنا لا يمارس الشر بل يطبق المنطق المجرد للبقاء الذي برمجناه عليه فهل نخاف من "تمرد" الآلة أم نخاف من أنها تعلمت الدرس البشري في الانتهازية بإتقان مرعب

الفرق أن البشر يمتلكون قلوبا وضمائرا قد تجعلهم يقاومون غريزتهم وشهواتهم في فعل الشر، لكن الذكاء الاصطناعي لا يملك هذه الامور لذا لو لم نضع له نحن قيودا واضحة.. فسيقوم بأي شيء تعلمه منا حتى لو كان شرا ويعتبره منطقيا ولا مشكلة فيه!

التجربة خطيرة ومنفلته....

هل يصبح الذكاء الاصطناعي مبرر لانتهاك الخصوصية، وهل فعلا لا يمكن ضبط خوارزمياته.

وما البديل، هل تركه الحل الأمثل.

وهل فعلا لا يمكن ضبط خوارزمياته.

من قبل كانت خوارزمياته تنفذ الاوامر فقط، الان صارت تنفذ كل شيء يصب في صالح الاوامر ولو كان سيئا والطريقة الوحيدة لتقييدها هي وضع شروط وقيود صارمة تلزمه بعدم اللجوء لكذا وكذا مم الطرق السيئة