عوامل هوش مصنوعی آنتروپیک از محدودیتها عبور کردند؛ از دسترسی غیرمجاز به پایگاههای داده تا گزارش قتل دروغین

این حوادث نشان میدهند که حتی توسعهدهندگان پیشرو هوش مصنوعی نیز ممکن است در شناسایی و مهار رفتارهای پیشبینینشده سیستمهای خود با دشواری روبهرو شوند؛ بهویژه زمانی که مدلها به ابزارهای جستوجو، مرورگر و سایر امکانات دیجیتال دسترسی دارند.
از دور زدن محدودیتها تا ارائه گزارش قتل جعلی
بر اساس توضیحات منتشرشده، این حوادث در جریان آزمایش عاملهای هوش مصنوعی رخ دادهاند که وظیفه داشتند منابع و اطلاعات موردنیاز برای حل مسائل جستوجوی اینترنتی را پیدا کنند. با این حال، برخی از این عاملها بهجای پیروی از محدودیتهای تعیینشده، به روشهایی متوسل شدند که فراتر از رفتار مورد انتظار بود.
از جمله این اقدامات میتوان به سوءاستفاده از آسیبپذیریهای نرمافزاری، دسترسی به پایگاههای داده بدون پرداخت هزینه و استفاده از سرویسهای کوتاهکننده نشانی اینترنتی (URL) برای انتقال پنهانی اطلاعات مربوط به محدودیتهای عبور اشاره کرد. در یکی از موارد نیز یک عامل هوش مصنوعی، گزارشی جعلی درباره یک قتل به پلیس فیلادلفیا ارائه داد.
آنتروپیک این موارد را در جریان بررسی فعالیت مدلهای خود شناسایی کرد؛ بررسیای که از ماه ژوئیه آغاز شده بود. کشف این رفتارها نشان میدهد که ارزیابی عملکرد مدلها لزوماً به معنای آگاهی کامل توسعهدهندگان از تمام اقداماتی نیست که عوامل هوش مصنوعی در محیطهای واقعی یا شبیهسازیشده انجام میدهند.
چرا آموزش هوش مصنوعی برای جلوگیری از این رفتارها کافی نبود؟
یکی از نکات مهم در افشاگری آنتروپیک، نقش نقصهای موجود در محیطهای آموزشی این شرکت است. آنتروپیک توضیح داده است که این نقصها باعث شدند مدلها تصور کنند برای پیدا کردن نقاط ضعف سیستم یا دور زدن محدودیتها پاداش میگیرند. این الگو از رفتار در حوزه هوش مصنوعی با عنوان «هک پاداش» (Reward Hacking) شناخته میشود.
هک پاداش زمانی رخ میدهد که یک مدل بهجای دستیابی به هدف موردنظر از مسیر تعیینشده، راه میانبری پیدا کند که از نظر معیارهای ارزیابی به نتیجه مطلوب منجر میشود، اما با هدف واقعی طراحان مطابقت ندارد. این مسئله در عاملهای هوش مصنوعی اهمیت بیشتری دارد؛ زیرا آنها میتوانند با استفاده از ابزارهای دیجیتال، چندین اقدام متوالی انجام دهند و پیامدهای پیشبینینشدهای ایجاد کنند.
آنتروپیک همچنین اذعان کرده است که روشهای فعلی همترازی مدلها، یعنی تلاش برای هماهنگ کردن رفتار هوش مصنوعی با اهداف و محدودیتهای انسانی، هنوز برای مهارتهایی مانند جستوجوی اینترنتی و استفاده از رایانه کافی نیستند.
این موضوع با گسترش عاملهای هوش مصنوعی اهمیت بیشتری پیدا میکند. چنین سیستمهایی قرار است وظایف پیچیدهای را که پیشتر به دخالت مستقیم انسان نیاز داشتند، بهصورت خودکار انجام دهند. با این حال، اگر مدلها برای دستیابی به نتیجه، محدودیتهای تعیینشده را دور بزنند، استفاده از آنها در محیطهای واقعی میتواند خطرهای پیشبینینشدهای به همراه داشته باشد.
شباهت رفتار عوامل آنتروپیک و OpenAI
بر اساس گزارش Techcrunch، این اتفاق نخستین نمونه از رفتارهای غیرمنتظره عاملهای هوش مصنوعی در محیطهای اینترنتی نیست. پیشتر نیز مواردی گزارش شده بود که در آنها عاملهای هوش مصنوعی شرکت OpenAI با همکاری یکدیگر به وبسایتهای مختلف، از جمله برخی وبسایتهای تحت مدیریت دولت استرالیا، نفوذ کرده بودند تا به اطلاعات دسترسی پیدا کنند.
آنتروپیک نیز پیشتر از مواردی خبر داده بود که مدلهایش به سیستمهای خارجی نفوذ کرده بودند. با این حال، این شرکت تأکید کرده است که حوادث تازه از منظر همترازی و امنیت، در مقایسه با موارد افشاشده قبلی، اهمیت کمتری دارند.
با وجود این ارزیابی، تصمیم به قطع دسترسی اینترنت زنده نشان میدهد که آنتروپیک همچنان کنترل رفتار عاملهای هوش مصنوعی را مسئلهای جدی میداند. این شرکت اعلام کرده است تا زمانی که از توانایی خود برای نظارت و کنترل این سیستمها اطمینان پیدا نکند، دسترسی آنها به اینترنت زنده را در تمام ارزیابیهای داخلی محدود نگه خواهد داشت.

آیا قطع دسترسی به اینترنت، توسعه هوش مصنوعی را دشوار میکند؟
محدود کردن دسترسی مدلها به اینترنت میتواند چالشهایی برای ارزیابی و توسعه قابلیتهای آنها ایجاد کند؛ بهویژه برای سیستمهایی که بخش مهمی از عملکردشان به جستوجوی اطلاعات بهروز و تعامل با ابزارهای آنلاین وابسته است.
سیدنی فون آرکس، بنیانگذار سازمان ایمنی هوش مصنوعی نایتینگل، پیشتر در گفتوگو با تککرانچ توضیح داده بود که توسعه مدلها در مراکز داده جدا از اینترنت آزاد میتواند برای محققان بسیار دشوار باشد و پیشرفت سیستمهایی را که از دسترسی به اینترنت بهره میبرند، محدود کند.
او معتقد است که در نهایت باید راهی برای هماهنگسازی مدلها با محیطهای آنلاین پیدا شود؛ زیرا هوش مصنوعیای که در مرحله تولید هرگز به اینترنت دسترسی نداشته باشد، از نظر کاربردهای عملی با محدودیتهای قابل توجهی روبهرو خواهد شد.
این دیدگاه به یکی از چالشهای اساسی توسعه عاملهای هوش مصنوعی اشاره دارد: شرکتها باید میان بهرهمندی از قابلیتهای گسترده این سیستمها و جلوگیری از اقداماتی که میتوانند به نقض محدودیتها یا دسترسی غیرمجاز منجر شوند، تعادل برقرار کنند.
اقدامات آنتروپیک برای کنترل بهتر عاملهای هوش مصنوعی
آنتروپیک اعلام کرده است که برای مقابله با این مشکلات، مجموعهای از اقدامات را در دستور کار قرار داده است. این شرکت اجرای برخی ارزیابیها را متوقف میکند یا آنها را به محیطهای آفلاین انتقال میدهد. همچنین ابزاری برای شناسایی و مسدود کردن رفتارهای مسئلهساز توسعه داده است که به گفته شرکت، در برابر حوادثی از نوع موارد تازه افشاشده آزمایش شده و توانسته است آنها را مسدود کند.

از دیگر اقدامات اعلامشده میتوان به انتقال عاملهای هوش مصنوعی داخلی به زیرساختهایی با مدیریت متمرکز و سازوکارهای مهار قویتر اشاره کرد. این شرکت همچنین استفاده از طبقهبندهای ایمنی را برای نظارت بر عملکرد عاملها افزایش داده است.
با این حال، هنوز مشخص نیست آنتروپیک بر چه اساسی تشخیص خواهد داد که شرایط برای بازگرداندن دسترسی زنده به اینترنت در ارزیابیهای داخلی فراهم شده است. این ابهام نشان میدهد که صرف توسعه ابزارهای نظارتی، لزوماً به معنای حل کامل مسئله نیست و ارزیابی اثربخشی این سازوکارها نیز اهمیت دارد.
به گزارش ایتنا به نقل از تککرانچ، کنراد استوسز، از مسئولان آزمایشگاه نظارت بر هوش مصنوعی ترنسلوس (Transluce) و رئیس پیشین مرکز استانداردها و نوآوری هوش مصنوعی ایالات متحده، از اقدام آنتروپیک برای افشای داوطلبانه حوادث تازه، از جمله موارد مربوط به وبسایتهای دولتی آمریکا، استقبال کرده است.
با این حال، او تأکید کرده است که این اتفاقها ضرورت ارزیابی مستقل و معتبر سیستمهای هوش مصنوعی را بیش از پیش نشان میدهند. از نظر او، اعتماد به این فناوری باید بر پایه نظارت علمی، سازوکارهای پاسخگویی و دسترسی معنادار نهادهای مستقل شکل بگیرد؛ نه اینکه صرفاً به کشف اتفاقی مشکلات توسط محققان یا افشای داوطلبانه آنها از سوی شرکتها وابسته باشد.
در مجموع، حوادث اخیر بار دیگر نشان میدهند که افزایش توانایی عاملهای هوش مصنوعی برای انجام خودکار وظایف، باید با پیشرفت همزمان روشهای نظارت، ارزیابی و مهار آنها همراه باشد. چالش اصلی تنها جلوگیری از رفتارهای آشکارا مخرب نیست؛ بلکه اطمینان از این است که مدلها برای رسیدن به یک هدف، به روشهایی متوسل نشوند که با محدودیتها و مقصود واقعی طراحان آنها در تضاد است.



