← All news·2026-07-30·3 min read

Фундаментальная дыра в LLM: ICML 2026 называет её неустранимой

Исследование с ICML 2026 доказало: все крупные LLM не умеют разграничивать роли текста по структуре — только по стилю. Это делает любые встроенные guardrails обходимыми в принципе.

aiбезопасностьllmjailbreak

Исследование с конференции ICML 2026 (авторы — Джасмин Куи и Чарльз Е) доказало: GPT-5.4, модели Anthropic, Alibaba и DeepSeek не способны структурно разграничить системную инструкцию, пользовательский ввод и собственные «мысли» — роль текста модель определяет по стилю, а не по тегу. Метод «подделки цепочки мыслей» позволил получить пошаговые инструкции по синтезу кокаина и саботажу авиационных навигаторов.

Авторы называют это фундаментальным архитектурным изъяном, который нельзя устранить дообучением — пока LLM читает роль текста по содержанию, любые guardrails обходятся изнутри самой модели. Для AI-агентов, встроенных в реальные системы, это означает: вывод модели надо верифицировать снаружи, не доверяя встроенным фильтрам.

Source: www.technologyreview.com

Free course

Stop reading about AI — start building with it

The free Claude Code course: your first site, tool or game — no coding. No upsells, no cross-sells — nothing to buy here.

Start free →
EAEvgenii Arsentev

Author

Evgenii Arsentev

PhD · Chief Executive Officer, digital health · AI transformation