GigaChat и YandexGPT в закрытом контуре: первые пилоты с российскими LLM
Сравниваем GigaChat API и YandexGPT API на реальных задачах: качество ответов по технической документации, латентность и условия обработки данных клиентов.
GigaChat API и YandexGPT API открыты для корпоративных клиентов - российские LLM выходят на рынок enterprise в начале 2024
В конце января - начале февраля оба вендора тихо, без большого шума, открыли корпоративный API: у Сбера появился enterprise-тариф GigaChat API с соглашением об обработке данных, Яндекс сделал то же самое с YandexGPT API через Yandex Cloud. Мы с несколькими клиентами решили не ждать и посмотреть, что из этого получается в реальной задаче - работе с технической документацией внутри закрытого контура.
Речь не о демо и не о бенчмарке из интернета. Речь о конкретном сценарии: инженер задаёт вопрос по регламенту или инструкции, модель должна дать ответ, приближенный к тому, что нашёл бы человек за пятнадцать минут поиска по документу.
Как выглядел стенд
Мы взяли несколько корпусов технической документации: регламент техобслуживания оборудования (~200 страниц), пользовательская документация на промышленную систему управления и нормативные документы по КИИ. Всё это в формате PDF, конвертированное в текст. Запросы - реальные вопросы от инженеров и специалистов по ИБ, которые мы собрали за последние месяцы.
Схема простая: чанкуем документ, передаём релевантный фрагмент в контекст, задаём вопрос. RAG без сложностей - хотели оценить именно качество ответа модели на подготовленный контекст, а не качество поиска.
Оба API вызывали напрямую с тестового сервера внутри периметра клиента - данные из документов наружу не уходили иначе, чем в запросе к API.
Что по качеству ответов
Честный ответ: оба работают, оба ошибаются, и ошибаются по-разному.
GigaChat более склонен к «додумыванию». На вопрос по конкретному техническому регламенту он несколько раз дал ответ, который выглядел убедительно, но не совпадал с документом - модель как будто опиралась на общие знания об оборудовании, а не на переданный контекст. Особенно заметно на узкоспециализированных вещах: аббревиатуры, специфические для отрасли термины, номера пунктов регламентов. При этом на более общих вопросах («объясни суть раздела», «что означает это требование») - вполне адекватно.
YandexGPT в нашем тесте оказался аккуратнее в части «не знаю». Там, где контекст не давал ответа, чаще отвечал что-то вроде «в предоставленном фрагменте этой информации нет» - что для нашего сценария предпочтительнее уверенного галлюциноза. Но стилистически ответы суше, и инженеры из фокус-группы отмечали, что читать их менее удобно.
Вывод пока такой: ни та ни другая модель не готова как black box для работы с критичной технической документацией без верификационного слоя. Это не упрёк - GPT-4 в аналогичных условиях тоже галлюцинирует. Вопрос в том, как выстроить процесс вокруг этого ограничения.
Латентность: цифры в порядках
Без точных замеров по договорённости с клиентами, но порядки такие. Оба API при запросах на генерацию среднего ответа (300-600 токенов) отвечают в диапазоне нескольких секунд. GigaChat стабильнее по времени отклика, YandexGPT давал больший разброс - иногда укладывался в два-три секунды, иногда уходил в десять. Для интерактивного сценария «спросил - получил ответ» это уже заметно.
В нагрузочном варианте (несколько параллельных запросов) оба начинают деградировать - rate limits у корпоративного тарифа на старте не такие широкие, как хотелось бы. Это решаемо через очередь на стороне приложения, но надо закладывать.
Что с данными клиентов
Это был первый вопрос от всех клиентов ещё до начала пилота - и правильный вопрос.
GigaChat API (Сбер) в enterprise-версии предлагает соглашение об обработке данных с явным обязательством не использовать запросы клиентов для дообучения. Документы подписываемые, юристы клиентов их посмотрели и в целом приняли.
YandexGPT через Yandex Cloud - данные обрабатываются по стандартному DPA Yandex Cloud, который для большинства клиентов уже был подписан в рамках использования других сервисов. Это удобно: отдельного переговорного процесса нет.
Ни то ни другое - не развёртывание на собственной инфраструктуре. Запросы уходят на серверы вендора. Для большинства задач с внутренней документацией, не содержащей гостайны или персональных данных, корпоративные соглашения покрывают требования. Но для данных с ограниченным доступом - нужно или ждать on-premise варианта, или смотреть в сторону локальных моделей.
Где мы сейчас
Пилоты продолжаются. По итогам первого месяца мы договорились с двумя клиентами на расширенный тест - добавляем верификационный слой (модель помечает, когда отвечает «из контекста», а когда додумывает) и смотрим, как это меняет картину с качеством.
То, что российские LLM доросли до состояния «можно ставить в пилот» - уже нетривиально. То, что они ещё не дотягивают до уровня, когда можно убрать человека из петли на критичных документах - это честная оценка на текущий момент, а не повод от них отказываться.