По мере того как большие языковые модели становятся мощнее, галлюцинации по-прежнему остаются трудноустранимой проблемой. Ошибки возникают даже в самых умных моделях, и хотя способы их обнаружения существуют, отрасль всё ещё ищет наилучший метод решения этой задачи.

Питер Элиас — основатель стартапа ProbablyИсточник изображения — techcrunch.com

Стартап Probably, только что привлёкший $9 млн начального финансирования от Andreessen Horowitz, пытается создать более строгий подход к выявлению таких ошибок.

Цель — 99,99% точности

Как отмечает основатель Питер Элиас, цель компании — не допустить попадания к пользователю ни галлюцинаций, ни простых фактических ошибок, добившись точности в 99,99%. Для детерминированных систем это норма, но для нейросетей достичь такого уровня несопоставимо сложнее. Как выяснилось, доведение модели до подобной точности требует пересмотра многих базовых принципов инженерии ИИ.

Первый продукт компании — инструмент для работы с данными, предназначенный для быстрого получения ответов из сложных наборов. Каждый результат сопровождается ссылкой на источник и аудиторским следом того, как он был получен, — практика, всё чаще встречающаяся в подобных инструментах.

реклама кормит Уточку 🦆

Как устроен «экзоскелет»

Чтобы не допустить проникновения ошибок в итоговые сводки, потребовалась сложная система контроля, которую основатель называет «экзоскелетом для работы с данными». Первичные ответы модели проверяются детерминированной системой валидации, которая отбрасывает любые результаты, не соответствующие исходному набору данных. Ключевой момент: модель обучена взаимодействовать с валидатором, и вся система оптимизирована под быстрые и точные ответы.

Принципиальная разница с распространёнными подходами здесь в том, что проверяющий компонент не является нейросетью. Популярная схема «пусть одна модель проверяет другую» страдает общим недостатком: обе способны ошибаться одинаково. Детерминированный валидатор либо находит утверждение в данных, либо нет — третьего не дано.

«Что мы поняли в процессе разработки: чем лучше ваша система контроля, тем менее мощной может быть модель, — говорит Элиас. — Если удаётся достаточно точно настроить контекст, модели не нужно прилагать больших усилий для получения правильного ответа. По сути, это упражнение по снижению неоднозначности».

реклама кормит Уточку 🦆

Почему это выгодно экономически

Такой подход позволяет инструменту работать на значительно более компактных моделях. По словам основателя, текущая версия использует модель, которая «на четыре класса слабее передовых». А это уже означает возможность запуска на локальном оборудовании — на обычном настольном компьютере вместо дата-центра — и существенное снижение затрат на обработку запросов.

Идея своевременна: стоимость обращений к моделям растёт, а многие компании пересматривают свои бюджеты на ИИ. У локального запуска есть и второй, не менее весомый аргумент — данные не покидают периметр организации. Для бухгалтерии, медицины и юриспруденции это зачастую решающий фактор, важнее любой экономии.

Замысел не ограничивается работой с данными: тот же движок можно распространить на бухгалтерский учёт, медицинские услуги и, по словам основателя, «на любые чувствительные к точности сценарии использования».

реклама кормит Уточку 🦆

Упрёк в адрес крупных лабораторий

«Я считаю очень интересным, что крупные лаборатории даже не пытались сделать это, — говорит Элиас. — У них нет стимулов, потому что они зарабатывают деньги тем больше, чем чаще вам приходится исправлять модель».

Утверждение полемическое, но не беспочвенное: бизнес-модель поставщиков моделей построена на объёме обработанных запросов, а каждое уточнение и переспрашивание этот объём увеличивает. Справедливости ради, крупные разработчики всё же вкладываются в надёжность — просто их подход состоит в улучшении самой модели, а не в строительстве внешних ограничителей вокруг слабой.

Ключевой вопрос к самому подходу остаётся открытым и в материале не проговаривается: детерминированный валидатор работает только там, где есть источник истины, с которым можно сверить ответ. Для запроса к базе данных или бухгалтерской выгрузке это выполнимо; для свободного текста, юридической трактовки или медицинской рекомендации — уже нет. Так что заявленные четыре девятки, скорее всего, относятся к строго очерченному классу задач, а не к нейросетям вообще.

Для команд из СНГ практическая ценность этой идеи вполне ощутима: маленькая модель плюс строгая проверка — рабочий рецепт там, где доступ к передовым зарубежным моделям ограничен, а данные нельзя выпускать за пределы контура.