Фундаментальная дыра в LLM: ICML 2026 называет её неустранимой
Исследование с ICML 2026 доказало: все крупные LLM не умеют разграничивать роли текста по структуре — только по стилю. Это делает любые встроенные guardrails обходимыми в принципе.
Исследование с конференции ICML 2026 (авторы — Джасмин Куи и Чарльз Е) доказало: GPT-5.4, модели Anthropic, Alibaba и DeepSeek не способны структурно разграничить системную инструкцию, пользовательский ввод и собственные «мысли» — роль текста модель определяет по стилю, а не по тегу. Метод «подделки цепочки мыслей» позволил получить пошаговые инструкции по синтезу кокаина и саботажу авиационных навигаторов.
Авторы называют это фундаментальным архитектурным изъяном, который нельзя устранить дообучением — пока LLM читает роль текста по содержанию, любые guardrails обходятся изнутри самой модели. Для AI-агентов, встроенных в реальные системы, это означает: вывод модели надо верифицировать снаружи, не доверяя встроенным фильтрам.
Source: www.technologyreview.com
Free course
Stop reading about AI — start building with it
The free Claude Code course: your first site, tool or game — no coding. No upsells, no cross-sells — nothing to buy here.
Start free →▌ Related guides

Author
Evgenii Arsentev
PhD · Chief Executive Officer, digital health · AI transformation
Articles · Latest articles