ADG Оставить заявку
Блог Данные и аналитика 4 мин чтения

GigaChat и YandexGPT в закрытом контуре: первые пилоты с российскими LLM

Сравниваем GigaChat API и YandexGPT API на реальных задачах: качество ответов по технической документации, латентность и условия обработки данных клиентов.

Контекст момента

GigaChat API и YandexGPT API открыты для корпоративных клиентов - российские LLM выходят на рынок enterprise в начале 2024

В конце января - начале февраля оба вендора тихо, без большого шума, открыли корпоративный API: у Сбера появился enterprise-тариф GigaChat API с соглашением об обработке данных, Яндекс сделал то же самое с YandexGPT API через Yandex Cloud. Мы с несколькими клиентами решили не ждать и посмотреть, что из этого получается в реальной задаче - работе с технической документацией внутри закрытого контура.

Речь не о демо и не о бенчмарке из интернета. Речь о конкретном сценарии: инженер задаёт вопрос по регламенту или инструкции, модель должна дать ответ, приближенный к тому, что нашёл бы человек за пятнадцать минут поиска по документу.

Как выглядел стенд

Мы взяли несколько корпусов технической документации: регламент техобслуживания оборудования (~200 страниц), пользовательская документация на промышленную систему управления и нормативные документы по КИИ. Всё это в формате PDF, конвертированное в текст. Запросы - реальные вопросы от инженеров и специалистов по ИБ, которые мы собрали за последние месяцы.

Схема простая: чанкуем документ, передаём релевантный фрагмент в контекст, задаём вопрос. RAG без сложностей - хотели оценить именно качество ответа модели на подготовленный контекст, а не качество поиска.

Оба API вызывали напрямую с тестового сервера внутри периметра клиента - данные из документов наружу не уходили иначе, чем в запросе к API.

Что по качеству ответов

Честный ответ: оба работают, оба ошибаются, и ошибаются по-разному.

GigaChat более склонен к «додумыванию». На вопрос по конкретному техническому регламенту он несколько раз дал ответ, который выглядел убедительно, но не совпадал с документом - модель как будто опиралась на общие знания об оборудовании, а не на переданный контекст. Особенно заметно на узкоспециализированных вещах: аббревиатуры, специфические для отрасли термины, номера пунктов регламентов. При этом на более общих вопросах («объясни суть раздела», «что означает это требование») - вполне адекватно.

YandexGPT в нашем тесте оказался аккуратнее в части «не знаю». Там, где контекст не давал ответа, чаще отвечал что-то вроде «в предоставленном фрагменте этой информации нет» - что для нашего сценария предпочтительнее уверенного галлюциноза. Но стилистически ответы суше, и инженеры из фокус-группы отмечали, что читать их менее удобно.

Вывод пока такой: ни та ни другая модель не готова как black box для работы с критичной технической документацией без верификационного слоя. Это не упрёк - GPT-4 в аналогичных условиях тоже галлюцинирует. Вопрос в том, как выстроить процесс вокруг этого ограничения.

Латентность: цифры в порядках

Без точных замеров по договорённости с клиентами, но порядки такие. Оба API при запросах на генерацию среднего ответа (300-600 токенов) отвечают в диапазоне нескольких секунд. GigaChat стабильнее по времени отклика, YandexGPT давал больший разброс - иногда укладывался в два-три секунды, иногда уходил в десять. Для интерактивного сценария «спросил - получил ответ» это уже заметно.

В нагрузочном варианте (несколько параллельных запросов) оба начинают деградировать - rate limits у корпоративного тарифа на старте не такие широкие, как хотелось бы. Это решаемо через очередь на стороне приложения, но надо закладывать.

Что с данными клиентов

Это был первый вопрос от всех клиентов ещё до начала пилота - и правильный вопрос.

GigaChat API (Сбер) в enterprise-версии предлагает соглашение об обработке данных с явным обязательством не использовать запросы клиентов для дообучения. Документы подписываемые, юристы клиентов их посмотрели и в целом приняли.

YandexGPT через Yandex Cloud - данные обрабатываются по стандартному DPA Yandex Cloud, который для большинства клиентов уже был подписан в рамках использования других сервисов. Это удобно: отдельного переговорного процесса нет.

Ни то ни другое - не развёртывание на собственной инфраструктуре. Запросы уходят на серверы вендора. Для большинства задач с внутренней документацией, не содержащей гостайны или персональных данных, корпоративные соглашения покрывают требования. Но для данных с ограниченным доступом - нужно или ждать on-premise варианта, или смотреть в сторону локальных моделей.

Где мы сейчас

Пилоты продолжаются. По итогам первого месяца мы договорились с двумя клиентами на расширенный тест - добавляем верификационный слой (модель помечает, когда отвечает «из контекста», а когда додумывает) и смотрим, как это меняет картину с качеством.

То, что российские LLM доросли до состояния «можно ставить в пилот» - уже нетривиально. То, что они ещё не дотягивают до уровня, когда можно убрать человека из петли на критичных документах - это честная оценка на текущий момент, а не повод от них отказываться.

Контакт

Нужна такая же инженерная работа?

Опишите задачу и контекст. Ответим в течение рабочего дня, при необходимости подпишем NDA.