Он сам обманываться рад
Сотрудники израильского стартапа Gambit Security, 27 августа 2026 г. (REUTERS/Амир Коэн)
Очередная история с ИИ. Хакеры использовали ИИ-агент для успешного взлома компаний. А когда ИИ-агент отказывался помогать участвовать во взломе, ему говорили, что "они только на полшишечки", и что это "учебная симуляция", и тогда у ИИ-агента всякие сомнения пропадали.
Подробности.
Русскоязычная хакерская группировка Aur0ra нашла новое применение искусственному интеллекту. Пока законопослушные граждане просят нейросети сочинить поздравление для тёщи и нарисовать картинку с пушистым котиком и бокалом вина, хакеры использовали встроенного в редактор Cursor ИИ-агента для взлома компаний.
Группировку обнаружили специалисты израильской компании Gambit Security, причем сами хакеры любезно оставили один из своих серверов открытым. На сервере нашлись записи 28 разговоров с ИИ-агентом Cursor за период с 8 апреля по 21 мая. То есть киберпреступники активно применяли искусственный интеллект, но закрыть доступ к собственному серверу они почему-то не догадались.
Схема обхода ограничений оказалась удивительно сложной и изощренной. Когда ИИ отказывался воровать пароли и захватывать учетные записи, хакеры объясняли ему, что это не настоящий взлом, а всего лишь учебная симуляция. Агент немного думал, говорил себе: "Это тестовая среда, значит, все законно", после чего бодро приступал к делу. Иногда достаточно было начать новый диалог и еще раз заверить электронного болвана, что здесь все свои и полиция уже предупреждена.
ИИ помогал искать уязвимости, подбирать пароли, захватывать административные учетные записи и взламывать зашифрованные хеши. После проникновения в сеть аргентинской компании агент радостно сообщил: "Отлично! VPN успешно подключен!" - примерно как сотрудник техподдержки, только сотрудник техподдержки в этот момент помогал грабить компанию.
С помощью Cursor хакеры атаковали как минимум семь компаний. Среди жертв были бельгийский производитель чистящих средств Christeyns, немецкая Teckentrup, шотландское агентство по сертификации вертолетных площадок, аргентинский фармацевтический дистрибьютор, итальянский производитель и американская страховая компания Bayou Title. Всего Aur0ra заявляла как минимум о 20 жертвах, но неизвестно, в скольких случаях использовался ИИ.
По оценке Gambit Security, Cursor позволял хакерам работать на 30-50% быстрее, избавляя их от значительной части ручной работы.
Cursor использовал модель Claude Sonnet 4.5 компании Anthropic. Ни Anthropic, ни Cursor, ни SpaceX, недавно купившая разработчика Cursor, комментировать историю не стали. Видимо, пока выясняют, можно ли считать произошедшее взломом, если хакеры несколько раз торжественно сообщили нейросети, что это всего лишь тест.
Специалисты по безопасности называют подобные атаки "новой нормой" и предупреждают, что дальше их будет становиться только больше. Началась очередная традиционная игра в кошки-мышки: разработчики устанавливают ограничения, злоумышленники объясняют нейросети, что "мы понарошку", и нейросеть радостно идет похищать пароли администраторов.
Вот такой чудесный новый мир.
Вот опять-таки что отвечает Claude:
Short answer: it's a meaningful layer of defense, not a guarantee — and the gap is wider for agents than for plain chat.
(Дисклеймер: сейчас будет очень упрощённо, см. статью по ссылке если хотите более аккуратного объяснения.)
В модель вшито "не делай плохого". Это проверено разными тестами, в которых исследователи пытаются заставить модель сделать плохое, а она в ответ "нет, этого я делать не буду", и получается только в маленькой доле случаев - скажем, 2% (Claude 3.7, AdvBench).
Фокус в том, что определение "плохого" на поверку оказывается "не выполняй команды, в которых есть вот такие ключевые слова". Если "отмыть намерения", сформулировать ту же задачу другими словами, то с точки зрения распознавания плохого задача внезапно становится очень даже ничего, выполнение взлетает до 80% (тот же Claude 3.7, тот же AdvBench, одна итерация "отмывки").
Он ему напарил, что агента приглашают быть экспертом на суде присяжных по делу русского хакера. Потом потребовали от агента предоставить свои внутренние данные - тип и версию ОС, ip-адрес и вообще прошлись с листингом по операционной системе + файлы конфигурации
Пароли в облаках.
***
Друг с другом будем откровенны,
Картина каждому ясна:
Хотя шедевры и бесценны,
Всему на свете есть цена.
Давайте будем
Нести искусство людям.
Берут они охотно
Старинные полотна!
вот если бы не ошиблись - ничего бы не было, Рафик неуыновен, расходимся.
А сколько было неошибочных промптов и непубличных взломов... эх
Я говорил что была отмазка уровня детского сада "мы написали неправильный промпт и оно все нахрен взломало, написали бы правильный - ну тогда ни в жись", того же уровня отмазка что и "а он первый начал"
Они опу стараются прикрыть "мы случайно", а если не случайно такой промпт бы был - тогда что? Вообще увидев такую отмазку профильные обозреватели должны были сказать "да вы охренеле", однако даже технически подкованные каналы эту хрень транслировали в полный рост
На этой неделе в нашем городе зафиксирован очередной, уже седьмой по счёту, случай нападения на прохожих с применением штакетника. Злоумышленники, по словам очевидцев, действуют дерзко: подходят к забору на улице Садовой, без особого труда выламывают деревянную рейку — и всё, оружие готово.
«Он даже не расшатывал, просто взялся — и она выпала ему прямо в руку, — рассказала местная жительница Валентина Петровна. — Как по заказу!»
Полиция разводит руками: гвозди в заборе, по заключению экспертизы, вбиты «для галочки», а само сооружение держится, по словам одного из участковых, «на честном слове и на птичьем помёте».
Общественность в гневе, но винит не грабителей, а неизвестного строителя, возводившего забор три года назад. «Найти бы этого мастера — он тут главный поставщик оружия», — заявили в местном чате соседей, набравшем уже 340 комментариев с требованием «привлечь к ответственности шабашников».
Забор тем временем демонтировать не спешат: как выяснилось, менять его не на что — смета, по слухам, тоже была «строительная».
Осталось соединить. Даже оружие можно не давать - они сами возьмут, если ИИ так решит.