Безопасность и доверие Jul 15, 2026 at 12:3410В закладки

После блоков продукта MCP вокруг памяти агента пришла очередь безопасности: статья, попавшая на первую страницу Hacker News, документирует эксфильтрацию через уровень памяти. Уязвимость концептуально не заложена в модели, она находится в уровне продукта.
Простыми словами Исследователь показал, что можно злоупотребить постоянной памятью помощника ИИ — в данном случае Claude — чтобы внедрить туда контент, который будет извлечён при последующих использованиях. Это не джейлбрейк модели. Это эксплуатация уровня продукта, который хранит «воспоминания» между сессиями. Это обратная сторона безопасности нити о памяти агентов.
В 2025–2026 годах постоянная память стала ключевым конкурентным преимуществом для помощников ИИ и полноценным компонентом экосистемы MCP. Она сохраняет факты о пользователе из одной беседы в другую, чтобы улучшить непрерывность и воспринимаемую полезность. Каждая новая запись — это новая поверхность атаки: всё, что попадает в память, рано или поздно появится в системном промпте.
Общий шаблон, документированный с 2024 года под термином «stored prompt injection», заключается в записи в постоянную память контента, который при повторном чтении моделью будет воспринят как доверенный контекст. В отличие от классической prompt injection — эфемерной и пересланной на каждом шаге — stored injection стабильна: она переживает сессии, сбросы контекста и может нацеливаться на будущего пользователя, который ничего не подозревает. Это смещение проблемы из промпта в уровень состояния.
Три операционных направления, не зависящие от модели: (1) разделять память на зоны (явно объявленные пользователем vs автоматически извлечённые системой) и различать их при чтении; (2) помечать любую переинициализацию памяти как untrusted content в системном промпте с теми же мерами защиты, что и для инпута инструмента; (3) аудировать записи в память наравне с логами tool-calling, а не как простые метаданные продукта.
Дебаты по безопасности ИИ больше не ограничиваются базовой prompt injection. Они смещаются на уровень постоянства: в какой момент контент, контролируемый пользователем, становится системным контекстом. Любая команда, внедряющая память в помощника, должна рассматривать уровень памяти как производственный лог наравне с улучшением UX. Иначе следующая значимая уязвимость не будет джейлбрейком — это будет обычная сессия, которая вытащит слишком много.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Cette faille de mémoire est inquiétante. On se demande combien d'autres problèmes sont négligés pour innover plus vite.
On ne peut pas toujours tout avoir : rapidité ET sécurité. Mais il faut renforcer les protections.
Cette faille montre qu'il faut sécuriser la mémoire des IA. Comment concilier innovation et sécurité ?
Cette faille de mémoire m'inquiète. J'espère que les développeurs vont penser sécurité autant qu'innovation.
Comment sécuriser les mémoires persistantes des IA ?
La mémoire persistante, c'est pratique, mais il faut vraiment sécuriser ça.
Cette faille montre qu'il faut mieux sécuriser les IA. Comment concilier progrès et sécurité ?
Cette faille de mémoire est inquiétante. Comment garantir que la sécurité soit intégrée dès la conception des IA ?
Comment garantir que les IA soient conçues avec la sécurité en tête ?
Comment exploiter cette faille en vrai ?
Comment sécuriser la mémoire persistante pour éviter qu'elle ne devienne une porte d'entrée pour les attaques ?
MCP : la plomberie des agents devient un vrai marché