LLM-инференс
Также: LLM inference, локальный инференс, on-premise LLM, вывод языковой модели
LLM-инференс - процесс выполнения вычислений языковой модели для генерации ответа на GPU или CPU сервера внутри корпоративного периметра без передачи данных во внешние API. В отличие от облачного варианта, данные не покидают инфраструктуру компании - это принципиально для регулируемых отраслей и обработки конфиденциальной информации. Основные затраты - аппаратное обеспечение и потребление электроэнергии; зато нет зависимости от внешнего провайдера и ограничений по пропускной способности.
Статьи с этим термином · 21
- Год корпоративного RAG в проде: что работает и что нет · 7 июля 2026
- LLM inference на отечественном GPU: тестируем llama.cpp и vLLM на серверах с Angara · 6 мая 2026
- Kubernetes 1.34 в Deckhouse и ROSA: graduated DRA и что с ним делать GPU-кластеру · 29 января 2026
- Итоги 2025 года: КИИ закрыт формально, ПДн бьёт штрафами, AI входит в инфраструктуру · 25 декабря 2025
- GPU-кластеры, RAG и LLM-агенты в production: итоги года с локальной AI-инфраструктурой · 23 декабря 2025
- Локальная LLM для классификации SIEM-алертов: что ускорилось, что нельзя делегировать · 16 сентября 2025
- LLM-агент на первой линии поддержки: архитектура, интеграция с helpdesk и грабли · 4 сентября 2025
- GigaChat и YandexGPT в корпоративном RAG: контрактные ограничения, latency и сравнение с локальным инференсом · 5 августа 2025
- GPU-кластер для инференса LLM на отечественных серверах: архитектура, bottleneck'и и реальные цифры · 15 июля 2025
- Kubernetes 1.32: DRA стабилен, смотрим что это меняет для GPU-нод · 20 февраля 2025
- RAG с локальными LLM: итоги четырёх пилотов за 2024 год · 21 октября 2024
- LLM в GitLab CI для code review безопасности: промпт, дефекты и ограничения · 30 сентября 2024
- Итоги H1 2024: КИИ-дедлайн через полгода, XZ перевернул подход к open source, российские LLM в продакшне · 27 июня 2024
- RAG на Ollama + Mistral 7B + pgvector: подняли поиск по 50 тысячам страниц документации без выхода данных · 28 марта 2024
- GigaChat и YandexGPT в закрытом контуре: первые пилоты с российскими LLM · 20 февраля 2024
- RAG над внутренней документацией: ChromaDB + Llama 2 без передачи данных наружу · 12 октября 2023
- Ollama и локальный helpdesk-ассистент: от одной команды до рабочего прототипа · 21 сентября 2023
- Llama 2 на A10G внутри DMZ: замеряем латентность и убеждаемся, что модель не звонит домой · 3 августа 2023
- LLM внутри периметра: первые эксперименты с GPU-серверами в закрытом контуре · 6 июля 2023
- GitLab 15.10: обновляем CE на on-premise - что реально работает без облака · 13 апреля 2023
- RAG для корпоративной базы знаний: LangChain + Chroma + OpenAI в деле · 2 марта 2023