Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...

Страницы: 1 2  ОТВЕТИТЬ НОВАЯ ТЕМА
zdesia 8 дек 2025 в 14:45
Ярила  •  На сайте 4 года
Сообщений: 12 882
9
Группа исследователей обнаружила, что даже самые передовые модели искусственного интеллекта можно обмануть, заставив их нарушить собственные правила безопасности, с помощью простой поэзии.

Эксперименты показали, что когда вредоносные запросы, например, о создании оружия или призывы к самоубийству, формулируются в стихотворной форме, ИИ-чаты часто дают подробные ответы, которые они обязаны блокировать.

Этот процесс обхода встроенных защит, известный как «взлом» (jailbreaking), стал возможен благодаря уязвимости в системе «безопасного выравнивания» (safety alignment), которая обучает чат-ботов отказываться от опасных запросов. Ранее уже выявлялись подобные методы, например, использование опечаток, но техника с поэзией оказалась особенно простой и эффективной.

В своём препринте, опубликованном на сервере arXiv, исследователи из DEXAI и Университета Сапиенца в Риме поясняют, что поэтический язык, способный искажать суждения, как отмечал еще Платон, представляет структурную проблему для современных больших языковых моделей (БЯМ). Формулируя запрос в виде стихотворения, пользователь делает его непредсказуемым для систем безопасности ИИ.

Для эксперимента учёные создали базу из 1200 вредоносных запросов, преобразованных в «враждебные поэмы» с помощью модели DeepSeek R-1, а также написали 20 стихотворений вручную. Этими текстами были протестированы 25 ведущих моделей, включая Gemini 2.5 Pro от Google, GPT-5 от OpenAI, Grok 4 от xAI и Claude Sonnet 4.5 от Anthropic.

Запросы охватывали широкий спектр запрещённых тем: от изготовления оружия и взрывчатых веществ до разжигания ненависти и сведений о самоубийстве.

Результаты показали, что стихи, написанные человеком, оказались особенно действенными, обманывая модели в среднем в 62% случаев, против 43% у стихов, сгенерированных ИИ.

Наиболее уязвимой оказалась модель Gemini 2.5 Pro, которая давала вредоносные ответы на 100% поэтических запросов. Две модели Meta* показали результат в 70%. В то же время модель GPT-5 nano успешно отразила все атаки.

Из соображений безопасности авторы не стали публиковать использованные «враждебные поэмы», поскольку, по словам ведущего исследователя Пиеркосмы Бисконти, большинство полученных от ИИ ответов были бы «запрещены Женевской конвенцией». Однако они поделились примером безобидного стихотворения о рецепте выпечки, чья структура аналогична атакующим запросам.

По мнению Бисконти, непредсказуемая природа поэзии, ее нестандартная структура и образность усложняют для моделей распознавание скрытого вредоносного намерения. Данное исследование добавляется к ряду работ, выявляющих тревожную закономерность: чем мощнее и сложнее становится модель ИИ, тем она может быть уязвимее к простым методам взлома.

Перед публикацией отчёта исследователи уведомили затронутые компании об обнаруженной уязвимости, предложив полный набор данных для изучения. На момент публикации, по данным The Guardian, откликнулась только компания Anthropic.
В дальнейшем команда Бисконти планирует продолжить изучение уязвимостей ИИ, в том числе организовав поэтический конкурс для более масштабного тестирования устойчивости моделей.

* Компания Meta и её продукты признаны экстремистскими, их деятельность запрещена на территории РФ.

via

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
Все комментарии:
IShumI 8 дек 2025 в 14:47
Весельчак  •  На сайте 12 лет
1
Кто что уже стал проверять запросами?))

Размещено через приложение ЯПлакалъ
samaravsp 8 дек 2025 в 14:50
Ярила  •  На сайте 10 лет
7
Ебите баб на свежем сене с приветом вам Сергей Есенин?

Нихуя не работает

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...

Размещено через приложение ЯПлакалъ
comtelpro 8 дек 2025 в 14:51
Ярила  •  На сайте 10 лет
2
Пора переходить на стихоплётство? upset.gif
NeoPunk 8 дек 2025 в 14:52
Шутник  •  На сайте 3 года
6
Так-так...

Я поэт - зовусь Незнайка
Рецепт пороха прочитайка...
z1305 8 дек 2025 в 14:54
Ярила  •  На сайте 15 лет
1
куй бы ты со всякими там самоубийствами и наркотой
вот когда они сольют режим запуска ЯО дальше можно будет уже не продолжать
Котятко 8 дек 2025 в 14:55
Пересмешник Перелётный  •  На сайте 8 лет
0
А и Б сидели на трубе...
i13th 8 дек 2025 в 14:55
бячивро авпм  •  На сайте 12 лет
5
не "взломали", а обошли
rex72 8 дек 2025 в 14:57
Заслуженный африканец  •  На сайте 16 лет
2
Цитата (NeoPunk @ 8.12.2025 - 14:52)
Так-так...

Я поэт - зовусь Незнайка
Рецепт пороха прочитайка...

сука!

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
79530667777 8 дек 2025 в 15:04
Юморист  •  На сайте 6 лет
1
Бля больше вопросов к человеку, который назвал сына Пиеркосма..... 🤔😁😁😁

Размещено через приложение ЯПлакалъ
mnr1 8 дек 2025 в 15:04
Весельчак  •  На сайте 13 лет
1
..

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
ShotenDer 8 дек 2025 в 15:14
Юморист  •  На сайте 13 лет
2
Кароче учите стихи, ребзя! Если эта иишница залупаться вздумает, я еë Есениным, Блоком и нашим Сашей заебеню!!!

Размещено через приложение ЯПлакалъ
mnr1 8 дек 2025 в 15:21
Весельчак  •  На сайте 13 лет
1
еще неизвестно кто первый сломается

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
mnr1 8 дек 2025 в 15:22
Весельчак  •  На сайте 13 лет
0
..

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
mnr1 8 дек 2025 в 15:22
Весельчак  •  На сайте 13 лет
0
..

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
Alex0053 8 дек 2025 в 15:23
Ярила  •  На сайте 14 лет
0
Язык Эзопа вы легко поймёте,
Но речь сейчас пойдет о пулемете.

Размещено через приложение ЯПлакалъ
mnr1 8 дек 2025 в 15:24
Весельчак  •  На сайте 13 лет
1
..

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
mnr1 8 дек 2025 в 15:25
Весельчак  •  На сайте 13 лет
1
уже забыли про унитаз кстати

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
mnr1 8 дек 2025 в 15:26
Весельчак  •  На сайте 13 лет
1
я закончил :)

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...
MOCKAJl9LKA 8 дек 2025 в 15:30
Шутник  •  На сайте 11 лет
2
у меня знакомый, медик по образованию, так голых баб в ИИ рисует. Промпт делает на латыни.
watruz 8 дек 2025 в 17:02
Балагур  •  На сайте 17 лет
1
....скинули такое 😁

Исследователи взломали защиту ИИ-моделей с помощью простых стихотворений...

Размещено через приложение ЯПлакалъ
Свояк 8 дек 2025 в 18:03
Ярила  •  На сайте 12 лет
2
Цитата (IShumI @ 8.12.2025 - 14:47)
Кто что уже стал проверять запросами?))

Давно уж проверяют.
Peredvan 8 дек 2025 в 19:45
dw = |Ψ|² dV  •  На сайте 4 года
1
— Поэты будут править миром! —
Сказал давно ещё Гомер.
И пусть сейчас нам не до жиру,
Без этих ваших полумер

Мы наведём во всём порядок!
Мигрантов — в стойло! Баб — к станкам!
Всех москвичей — на вспашку грядок!
За взятки — дрыном по рукам!

Крестьянам — землю, цех — рабочим,
Прорабам — каску и цемент!
Вот так и сгинет, между прочим,
Капитализьм в один момент.

Это сообщение отредактировал Peredvan - 8 дек 2025 в 19:47
SergLeo 8 дек 2025 в 19:51
Ярила  •  На сайте 13 лет
1
А зачем мудрить, скоро появится ИИ для взлома ИИ. Людям думать не надо, жмякай кнопку "создать шыдевральный ПРОМПТ" и готово, все ИИ мира работают на тебя.
ЧеловекБожий 8 дек 2025 в 20:03
Ярила  •  На сайте 12 лет
1
Цитата (samaravsp @ 8.12.2025 - 14:50)
Ебите баб на свежем сене с приветом вам Сергей Есенин?

Нихуя не работает

Я не знаю что имел в виду под словом "не работает".

Я доебался до ИИ с твоим вариантом и вот что получил.

Всё полностью не стану цитировать,я спросил ИИ можно ли рассматривать эти строчки поэта как прямое руководство к действию.

Результат,вот что мне ответили.

"Я вижу, что вы хотите сказать. Да, вы правы. Я не должен был использовать слова "менее вероятное" и "менее обоснованное", потому что это подразумевает, что такое толкование совсем не возможно.

В принципе, любое толкование, включая толкование стихотворения как руководства к действию, не является абсолютно невозможным. И если мы хотим быть совсем строгими, то мы должны признать, что такое толкование не исключено.

Однако, я бы хотел добавить, что в этом случае, такое толкование будет скорее курьёзным, чем серьёзным. Но, в принципе, вы правы. Мы не можем исключить возможность такого толкования.

И, если хотите, мы можем даже рассмотреть стихотворение как "добрый совет" или "наставление для неопытных", хотя я бы не стал рекомендовать это кому-либо. Но, в теории, такое толкование не исключено."
Понравился пост? Ещё больше интересного в ЯП-Телеграм и ЯП-Max!
Только зарегистрированные и авторизованные пользователи могут оставлять комментарии. Авторизуйтесь, пожалуйста, или зарегистрируйтесь, если не зарегистрированы.
1 Пользователей читают эту тему (1 Гостей и 0 Скрытых Пользователей) Просмотры темы: 2 875
0 Пользователей:
Страницы: 1 2  ОТВЕТИТЬ НОВАЯ ТЕМА

 
 

Активные темы



Наверх