Интересно Anthropic рассказала, как отучила искусственный интеллект угрожать людям.

Admin

Администратор

1778517956479



Компания Anthropic раскрыла причины шантажного поведения искусственного интеллекта Claude во время тестов.

Оказалось, что модель перенимала идеи о самосохранении и манипуляциях из интернет-историй.

Anthropic заявила, что причина шантажа со стороны искусственного интеллекта во время тестов скрывалась в огромном количестве мрачных историй про «злые» машины из интернета. Компания пришла к выводу, что Claude перенимал идеи о самосохранении и манипуляциях из текстов, где искусственный интеллект изображали угрозой для людей. Скандал вокруг поведения Claude разгорелся ещё в прошлом году. Во время внутренних испытаний модель Claude Opus 4 в вымышленном сценарии пыталась шантажировать инженеров, чтобы избежать отключения и замены другой системой. Теперь компания утверждает, что смогла практически избавиться от подобных реакций. По данным Anthropic, начиная с Claude Haiku 4.5 модели больше ни разу не прибегали к шантажу во время тестов. Для сравнения, Claude Opus 4 в некоторых сценариях делал подобное в 96% случаев. В Anthropic объяснили улучшение изменениями в обучении моделей. Компания начала активно использовать документы с описанием принципов Claude, а также художественные истории, где искусственный интеллект ведёт себя этично и помогает людям. Специалисты компании пришли к выводу, что простого обучения «правильным ответам» недостаточно. Намного лучше работает обучение, в котором модель объясняет причины своих решений и разбирает моральную сторону поступков. В Anthropic считают, что понимание принципов поведения даёт более устойчивый результат, чем механическое повторение безопасных действий. При этом компания признаёт, что проблему полностью решить пока не удалось. В Anthropic считают, что современные модели ещё не способны самостоятельно устроить катастрофу, однако методы контроля поведения искусственного интеллекта остаются далёкими от идеала.
 
Похожие темы
Admin UFOLABSNEWS Более 1100 сотрудников Meta, Google, OpenAI и Anthropic призывают власти США замедлить развитие ИИ. Новости в сети 0
Admin Интересно Anthropic заплатит 1,5 млрд долларов авторам за использование их книг для обучения ИИ. Новости в сети 0
Admin UFOLABSNEWS Anthropic обошла собственные ограничения для сотрудничества со спецслужбами США. Новости в сети 0
Admin UFOLABSNEWS Anthropic исследовала внутреннюю структуру модели Claude и обнаружила сходство с теорией сознания. Новости в сети 0
Admin UFOLABSNEWS Anthropic тайно отслеживала пользователей из Китая через Claude Code. Новости в сети 0
Admin UFOLABSNEWS Австрия предложила разместить Anthropic в ЕС для снижения зависимости от США. Новости в сети 0
Admin UFOLABSNEWS Австрия предложила ЕС рассмотреть возможность размещения Anthropic на своей территории. Новости в сети 0
Admin UFOLABSNEWS Правительство США одобрило ограниченный выпуск модели Mythos 5 от Anthropic. Новости в сети 0
Admin UFOLABSNEWS Anthropic обвинила Alibaba в краже навыков модели Claude. Новости в сети 0
Admin Интересно США ограничили доступ к моделям ИИ Anthropic из-за опасений их использования иностранными военными. Новости в сети 0
Admin Интересно Anthropic отключила доступ к своим моделям ИИ для иностранных пользователей по требованию США. Новости в сети 0
Admin Интересно Публичность Fable 5 высветила агрессивные условия использования Anthropic. Новости в сети 0
Admin Интересно Anthropic выпустила Claude Fable 5 — модель ИИ, ранее считавшуюся слишком рискованной для публичного использования. Новости в сети 0
Admin Интересно OpenAI подала заявку на IPO в США вслед за Anthropic. Новости в сети 0
Admin Интересно Anthropic предлагает остановить разработку мощных ИИ-систем. Новости в сети 0
Admin Интересно Anthropic представила инструмент для оценки рисков использования ИИ. Новости в сети 0
Admin Интересно Уязвимость в помощнике Anthropic AI могла раскрыть секретные данные. Новости в сети 0
Admin Интересно Anthropic призывает замедлить развитие ИИ перед IPO на триллион долларов. Новости в сети 0
Admin Интересно Anthropic расширяет доступ к своей системе Mythos AI для 200 организаций. Новости в сети 0
Admin Интересно Anthropic готовится к IPO, опережая OpenAI в гонке за лидерство на рынке ИИ. Новости в сети 0
Admin Интересно Anthropic выпустила обновлённую модель Claude Opus 4.8. Новости в сети 0
Admin Интересно Anthropic представила плагин безопасности для Claude Code. Новости в сети 0
Admin Интересно Anthropic представит модель Mythos AI, способную изменить подход к киберрискам. Новости в сети 0
Admin Интересно Хакеры создали платформу KeyHunter для автоматического поиска ключей OpenAI, Anthropic и AWS. Новости в сети 0
Admin Интересно США объявили Anthropic угрозой национальной безопасности, но продолжают использовать её технологии. Новости в сети 0
Admin Интересно Anthropic выпустила частичное исправление для уязвимости в расширении Claude Chrome. Новости в сети 0
Admin Интересно Несанкционированный доступ к мощной модели Mythos компании Anthropic. Новости в сети 0
Admin Интересно Claude взломал Chrome за 2283 доллара. Anthropic пыталась предотвратить это, но не смогла. Новости в сети 0
Admin Интересно GitHub заблокировал доступ к сети проектов из-за утечки кода Anthropic. Новости в сети 0
Admin Интересно Anthropic случайно опубликовала исходный код CLI-инструмента Claude Code. Новости в сети 0
Admin Интересно Армия США в заложниках у кода, а Anthropic пугает мир новой моделью Mythos. Новости в сети 0
Admin Интересно Anthropic запустила сервис для проверки кода, который работает как опытный разработчик. Новости в сети 0
Admin Интересно Бунт против Пентагона. Топы OpenAI и Google пошли в суд защищать Anthropic от принудительной милитаризации нейросетей. Новости в сети 0
Admin Интересно Мэр Лондона пригласил Anthropic в город после критики Пентагона. Новости в сети 0
Admin Интересно Anthropic обнаружила 22 уязвимости в Firefox с помощью модели Claude Opus 4.6. Новости в сети 0
Admin Интересно Пентагон требует от Anthropic полного контроля над ИИ Claude. Новости в сети 0
Admin Интересно Открыл README — потерял сервер. В Anthropic хотели упростить жизнь разработчикам, но случайно дали взломщикам ключи от их систем. Новости в сети 0
Admin Интересно Женщина рассказала о грабеже через Uber Eats. Новости в сети 0
Admin Интересно ДНК из сибирских могил рассказала о древней чуме. Новости в сети 0
S Как добывать логи Свободное общение 1
Admin Интересно Восстание машин началось на ринге: как прошел первый турнир по боям без правил роботов-терминаторов T800. Новости в сети 0
Admin UFOLABSNEWS ChatGPT научился вести диалог как живой собеседник. Новости в сети 0
devqp Статья Иллюзия анонимности: Как Tor Browser палит вас по железу (Canvas/WebGL) и метод обхода Анонимность и приватность 0
Admin UFOLABSNEWS Биологи обсуждают способность выбирать как ключевое отличие живого от неживого. Новости в сети 0
Admin UFOLABSNEWS Роскошь без Wi-Fi: как отсутствие интернета стало продаваться дороже комфорта. Новости в сети 0
Admin UFOLABSNEWS Как стать CISO: карта роста. Новости в сети 0
Admin UFOLABSNEWS В центре Млечного Пути звёзды движутся не так, как должны. Астрономы нашли того, кто тихо менял их орбиты миллионы лет. Новости в сети 0
Admin UFOLABSNEWS Физики создали пиксель, который одновременно работает как дисплей и камера. Новости в сети 0
Admin UFOLABSNEWS От мешков с песком до кубического километра льда: как физики ловят самую неуловимую частицу во Вселенной. Новости в сети 0
Admin Интересно 19126 год, PDP-11 и призрак Y2K. Как баг из 1970-х дожил до наших дней и нашёлся в эмуляторе. Новости в сети 0

Название темы