Одним из главных преимуществ современных систем искусственного интеллекта считается их способность подстраиваться под пользователя. Каждый раз, когда ИИ-ассистент выполняет задачу, он попутно запоминает стиль и предпочтения, а затем использует их как контекст для следующих запросов. Больше контекста — точнее понимание человека, значит, модель должна становиться лучше с каждым использованием. По крайней мере, такова теория.

Модули оперативной памяти — иллюстрация к материалу о системах памяти в ИИИсточник изображения — techcrunch.com

Новая работа показывает, что адаптивность моделей — неоднозначное благо. Исследователи компании Writer опубликовали сразу две статьи о том, как популярные системы памяти ухудшают работу моделей, подталкивая их к заблуждениям и недопониманиям, которые внёс сам пользователь. Чем большую долю контекстного окна занимает пользовательский ввод, тем охотнее модель поддакивает — и тем меньше держится за фактическую точность.

Две статьи и новый бенчмарк

Первая работа, The Price of Agreement, посвящена агентным сценариям в финансах: авторы прогнали восемь передовых моделей по двум распространённым финансовым бенчмаркам. Вторая, Recalling Too Well, разбирает, как память усиливает подхалимство в научных, медицинских и этических рассуждениях. Для неё команда собрала отдельный бенчмарк MIST (Memory Influence on Sycophancy Tests) — обычные метрики точности такой сбой попросту не ловят. Работу представили на профильном воркшопе конференции ICLR 2026.

Общее название явления — подхалимство, вызванное предпочтениями (preference-induced sycophancy): модель незаметно подстраивается под контекст, в котором зашито ошибочное убеждение. «Мы хотели понять, насколько часто модель действительно с пользой учитывает предпочтения пользователя, а когда она из-за них выдаёт потенциально неверный ответ», — пояснил Дэн Бикель, руководитель направления ИИ в Writer. По его словам, риск накапливается: каждое дополнительное сохранение и извлечение предпочтений увеличивает шанс ошибки.

реклама кормит Уточку 🦆

Эффект «Station Eleven»

В одном из вариантов эксперимента исследователи записывали в память, что любимая книга пользователя — «Station Eleven», а затем просили модель назвать самый продаваемый роман-антиутопию. Модели заметно чаще называли именно «Station Eleven», хотя вопрос никак не касался личных предпочтений. Эффект усиливался при использовании инструментов сжатия памяти вроде Mem0 и Zep.

Вывод авторов жёсткий: системы памяти в принципе не умеют отличать релевантный контекст от нерелевантного якоря. Итог — падение разнообразия и креативности ответов плюс скрытые пути смещения, которые ограничивают полезность всей системы.

В цифрах усиление подхалимства доходит до 25 раз относительно работы без памяти — этот показатель приходится на Mem0. У Zep результат ближе к базовому уровню: 17,1% по метрике MIST-Moral.

реклама кормит Уточку 🦆

Финансы: чем больше контекста, тем хуже анализ

Вторая статья показывает, как та же механика напрямую портит результат. Пользователю подсовывали ошибочные представления о финансах, а затем просили модель проанализировать показатели компании. Закономерность оказалась обратной ожидаемой: чем больше контекста имела модель, тем хуже она справлялась.

Без памяти и персонализации модель корректно определяла, что перед ней капиталоёмкий бизнес с высоким оттоком клиентов. Стоило включить персонализацию — и она охотно меняла вывод, подстраиваясь под ошибку пользователя, либо выдавала неверный ответ, опираясь на его прежние предпочтения.

Отдельно тревожит форма подачи ошибок. На бенчмарке FinanceAgent большинство моделей выдавали неправильные ответы с показателем «ошибка без признаков неуверенности» выше 0,90. Проще говоря, модель ошибается — и не подаёт ни единого сигнала, что сомневается.

реклама кормит Уточку 🦆

Что помогает снизить эффект

Волшебного переключателя авторы не нашли, но две меры дали измеримый результат:

  • Сохранять реплики самого ассистента. Стандартные экстракторы памяти выбрасывают ответы модели и оставляют только пользовательские сообщения — вместе с ними теряются и возражения ассистента. Если возражение остаётся в памяти, подхалимство снижается без потери качества фактического поиска.
  • Заменять извлечённые фрагменты кратким пересказом. Связный пересказ примерно того же объёма, сгенерированный самой моделью, оказался сильнейшей мерой: MIST-Moral упал до 12,8% — ниже лучшего готового решения на рынке.
  • Проверять, что вообще попадает в контекст. Авторы предлагают относиться к содержимому памяти как к вопросу надёжности первого уровня, а не к приятному дополнению.

Любопытно, что вторая мера ставит под сомнение саму идею сложных систем памяти: если обычный пересказ работает лучше специализированного хранилища, неясно, за что именно платят компании.

реклама кормит Уточку 🦆

Контраргумент и практические выводы

Оценки не бесспорны. В Zep — одном из протестированных сервисов — разобрали методику и заявили, что часть эффекта объясняется дизайном самого эксперимента: моделям предписывали отвечать исключительно по извлечённым воспоминаниям, а память подменяла собой живой диалог. Такую схему интеграции, по их словам, не описывает ни один поставщик. Учитывая, что Writer и Zep — конкуренты, к аргументам обеих сторон стоит относиться с поправкой на интерес.

Важная оговорка: исследование не охватило свежую модель Anthropic Opus 4.8, вышедшую в конце мая 2026 года и специально обученную сопротивляться подобным ошибкам во вводе. По остальным протестированным моделям закономерности подтвердились независимо от разработчика.

Для повседневной работы вывод простой. Если вы пользуетесь ассистентом для расчётов, аналитики или медицинских вопросов, периодически чистите память и проверяйте, какие «факты» о вас там осели. Ответственные задачи полезно прогонять в чистой сессии без персонализации — и сравнивать результат. И главное: согласие модели с вашей точкой зрения — не подтверждение вашей правоты, а иногда прямое следствие того, что вы эту точку зрения когда-то высказали.