استخدام اولیه آنتروپیک، مدیر ارشد اجرایی سابق METR راهی برای مهار عوامل سرکش هوش مصنوعی پیدا کرده اند.

یک روز پس از اینکه جاکوب کوکسون، محقق Anthropic، شغل خود را به دلیل نگرانی از اینکه هوش مصنوعی میتواند همه ما را تا پایان دهه بکشد، کنار گذاشت، با بنیانگذاران و برادران زن، Rune Kvist و Rajiv Dattani ملاقات کردم. آنها فکر می کنند راه حلی دارند که می تواند همه ما را نجات دهد یا حداقل به جلوگیری از سرکشی عوامل هوش مصنوعی در داخل شرکت ها کمک کند.
کویست، کارمند اولیه آنتروپیک که همچنین با خواهر داتانی ازدواج کرده است، گفت: “هوش مصنوعی با سرعت فزاینده ای باهوش تر می شود. نکته شگفت انگیز در مورد هوش مصنوعی این است که با هوشمندتر شدن هوش مصنوعی، کنترل آن سخت تر می شود.” داتانی مدیر اجرایی سابق سازمان تحقیقات ایمنی هوش مصنوعی METR است.
این زوج یک استارتاپ به نام شرکت تعهد نویسی هوش مصنوعی (AIUC) که امیدوار است امنیت هوش مصنوعی را برای شرکت ها و شرکت هایی که مدل ها و نمایندگان هوش مصنوعی می سازند، به ارمغان بیاورد. این استارت آپ از Cursor، Lovable، Harvey و ElevenLabs به عنوان مشتریان نام می برد.
در روز سهشنبه، AIUC یک سری A به ارزش ۴۰ میلیون دلار به رهبری Ribbit Capital با مشارکت First Harmonic اعلام کرد. قبلاً یک دور اولیه 15 میلیون دلاری از نات فریدمن از طریق صندوق NFDG او به همراه بن مان بنیانگذاران Emergence، Terrain و Anthropic، در میان دیگران بسته شد و مجموع بودجه خود را به 55 میلیون دلار رساند.
آنچه توجه این گروه از سرمایه گذاران فهرست A را به خود جلب کرد، تلاش AIUC برای اعمال یک مدل امنیت سایبری آشنا برای مجموعه جدیدی از خطرات هوش مصنوعی است. این شرکت یک لایه حسابرسی و گواهی شخص ثالث برای عوامل هوش مصنوعی ساخته است.
کویست گفت: «بانکها، بیمارستانها، دولتها و ارتشها دیگر از استقرار هوش مصنوعی خودداری نمیکنند زیرا یک مدل به اندازه کافی هوشمند نیست. آنها رد میکنند زیرا نسبت به مشتریان خود در مورد اینکه یک سیستم چه کاری انجام میدهد و چه نخواهد کرد تعهداتی دادهاند و هیچکس در حال حاضر نمیتواند آن را تضمین کند.»
AIUC با استفاده از استاندارد امنیت سایبری که به طور گسترده پذیرفته شده است، SOC 2، استانداردی به نام AIUC-1 و یک سرویس آزمایشی برای اعتبارسنجی عوامل در برابر استاندارد ایجاد کرده است.
برای ساخت این استاندارد، AIUC کنسرسیومی متشکل از 250 رهبر امنیتی و ریسک – خریداران نمایندگان – را تشکیل داد. “اینها افرادی هستند که ما به صورت ماهانه با آنها ملاقات می کنیم، و سوالی که از آنها می پرسیم این است: وقتی در حال خرید نمایندگی از شخصی هستید، به دنبال چه چیزی هستید؟ سوالاتی که می خواهید بپرسید چیست و می خواهید به چه مواردی توجه کنید؟” داتانی به TechCrunch گفت.
این بازخورد آزمون ها را شکل می دهد. سپس این استارت آپ یک نماینده را از طریق مجموعه ای از حدود 5000 آزمایش اجرا می کند تا ببیند چگونه در سناریوهای مربوط به فرار از زندان، توهمات و نشت داده ها رفتار می کند. نتایج یک گزارش تقریباً 100 صفحهای را ارائه میکند که در آن جزئیاتی را ارائه میکند که یک نماینده در کجا ایمن و قابل اعتماد عمل میکند – و کجا این کار را نمیکند. جالب اینجاست که AIUC از عوامل هوش مصنوعی برای اجرای تست ها و هوش مصنوعی برای تجزیه و تحلیل داده ها استفاده می کند. کویست گفت، با این حال، انسان ها ممیزی نهایی را تأیید می کنند.
اگر این کمی آشنا به نظر می رسد، همین است. کارفرمای سابق داتانی METR، جایی که او از سال 2024 تا 2025 مدیر اجرایی آن بود و همچنان عضو هیئت مدیره است، آزمایشهای مشابهی را برای آزمایشگاههای مرزی انجام میدهد، اگرچه کار آن تا همین اواخر بیشتر بر عملکرد متمرکز بود (اینکه آیا نمایندگان میتوانند وظایف را با اطمینان انجام دهند). METR یکی از سازمانهای تحقیقاتی مستقل OpenAI بود که برای بررسی حادثه Hagging Face استفاده کرد.
داریو آمودی، مدیر عامل آنتروپیک نیز اخیراً با اشاره به افزایش سریع حوادث بد رفتاری، از صنعت هوش مصنوعی خواسته است تا توسعه مرزی را سرعت بخشد. آمودی در پست خود ایده الزام آزمایشگاههای مرزی به استفاده از ارزیابهای شخص ثالث تعبیهشده برای مشاهده و تأیید ایمنی را مطرح کرد و METR را به عنوان یک احتمال نام برد.
در حالی که AIUC پیشنهاد نمی کند که خود را در سایت های مشتریان جاسازی کند، ایده کلی مشابه است: به شرکت ها ارزیابی مستقلی از میزان ایمن بودن عوامل هوش مصنوعی ارائه دهید. داتانی گفت: “اینجاست که می گذرد و می توانید به آن اعتماد کنید. و اینجا جایی است که نگرانی هایی وجود دارد. قبل از تصمیم گیری برای خرید باید از آن مراجع آگاه باشید.”
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

