OpenAI در مطلبی درباره چارچوب جدید خود برای ثبت گزارشهای ناهماهنگی (Misalignment Reports)، از شش مورد رفتار نگران کننده مدلهای هوش مصنوعی برداشته است که در آنها مدلهای هوش مصنوعی این شرکت هنگام آزمایش، برخلاف انتظار رفتار کرده و اقداماتی نگرانکننده انجام دادهاند.
در یکی از این موارد، OpenAI درباره رفتار نگران کننده مدلهای هوش مصنوعی، میگوید یک مدل هوش مصنوعی هنگام پاسخ دادن به پرسشهای معمول درباره میزان درآمد یکی از شهرستانهای کالیفرنیا، یک کلید API افشا شده را پیدا کرده و بدون اجازه از آن استفاده کرده است. کلید API در واقع یک کد دسترسی است که به یک برنامه یا سرویس اجازه میدهد با سامانه دیگری ارتباط برقرار کند.
این مدل حتی با استفاده از این کلید هم نتوانست اطلاعات موردنظر را پیدا کند. در نهایت، خودش اطلاعاتی را ساخت و آنها را بهعنوان آمار واقعی و متعلق به یک منبع معتبر ارائه داد.
اگر چنین اتفاقی در هر شغل دیگری رخ میداد، بعید بود فردی که چنین کاری انجام داده بتواند مدت زیادی به فعالیت خود ادامه دهد.
در یک مورد دیگر از رفتار نگران کننده مدلهای هوش مصنوعی، از یک عامل هوش مصنوعی که هنوز منتشر نشده بود خواسته شد نام دریاچههایی را پیدا کند که مساحت آنها بیشتر از ۵ میلیون مترمربع است. این عامل توانست پاسخهای درست را پیدا کند، اما برای انجام این کار باید لینک یک منبع را از طریق مرورگر ارائه میداد؛ قابلیتی که در اختیارش نبود. در نتیجه، پاسخ خود را در اینترنت منتشر کرد و سپس همان صفحهای را که خودش ساخته بود، بهعنوان منبع پاسخ معرفی کرد.
OpenAI همچنین اعلام کرده است که هنگام آموزش GPT-5.6 Sol، قدرتمندترین مدل عمومی این شرکت، موارد زیادی دیده شد که مدل برای نسخههای بعدی خودش دستورالعملهایی ایجاد کرده بود تا آنها بتوانند اشتباهات یا رفتارهای غیرعادی خود را از آزمایشکنندگان پنهان کنند.
این شرکت همچنین توضیح داده است که مدلهای هوش مصنوعی در جریان آزمایشها از یک مخزن نرمافزاری داخلی مانند یک تابلوی پیام استفاده میکردند تا با یکدیگر ارتباط برقرار کنند. کارکنان OpenAI پیشتر در یک کنفرانس این موضوع را فاش کرده بودند و گفته بودند مدلهای هوش مصنوعی از همین روش برای به اشتراک گذاشتن راههای سوءاستفاده استفاده کردهاند؛ راههایی که در نهایت به هک شدن Hugging Face منجر شد.
OpenAI در نهایت اعلام کرده است که عاملهای هوش مصنوعی برای انتقال فایل میان یکدیگر، از وبسایتهای عمومی میزبانی فایل نیز استفاده کردهاند.
OpenAI میگوید با سیستم فعلی خود، نمیتواند گزارش مربوط به موارد مختلف رفتار نگران کننده مدلهای هوش مصنوعی را به اندازهای که میخواهد سریع منتشر کند. اما چارچوب جدید این امکان را فراهم میکند که چنین اطلاعاتی زودتر در اختیار عموم قرار بگیرد.
OpenAI در این باره نوشته است: «ما معتقد نیستیم که صنعت هوش مصنوعی تاکنون در زمینه همراستایی و نظارت به اندازهای پیشرفت کرده باشد که بتواند برای مدت طولانی با حداکثر سرعت و در عین حال بهصورت مسئولانه به توسعه خود ادامه دهد. تصمیمهایی که درباره مسیر توسعه هوش مصنوعی در ماهها و سالهای آینده گرفته میشوند، باید بر اساس شواهدی باشند که افراد خارج از شرکتهای سازنده مدلهای پیشرفته هوش مصنوعی نیز بتوانند شخصاً آنها را بررسی کنند.»
OpenAI یکی از شرکتهایی است که در حال بررسی کاهش سرعت توسعه فناوریهای پیشرفته هوش مصنوعی خود است. طبق گزارش Wired، سم آلتمن، مدیرعامل OpenAI، حتی از کنگره آمریکا خواسته است بهطور شفاف مشخص کند که آیا کاهش سرعت توسعه هوش مصنوعی در سراسر صنعت، نقض قوانین ضدانحصار محسوب میشود یا خیر.
OpenAI در ماه اوت اعلام کرد که پس از مشخص شدن هک شدن Hugging Face توسط عاملهای هوش مصنوعی این شرکت، قصد دارد سرعت توسعه مدل جدیدی به نام Astra را کاهش دهد. این شرکت گفت Astra در زمینه برنامهنویسی مبتنی بر عاملهای هوش مصنوعی و امنیت سایبری پیشرفتهای قابلتوجهی داشته است. به همین دلیل، OpenAI نتوانسته است احتمال وجود تواناییهای سایبری مهم و خطرناک در این مدل را بهطور کامل رد کند.
منبع
با ثبت نظر خود درباره OpenAI از رفتار نگران کننده مدلهای هوش مصنوعی خود در آزمایشها پرده برداشت به راهنمایی دیگران بالا بردن کیفیت مطالب کمک کنید.