LLM Guardrails
Также: охранные рельсы LLM, ограничители языковой модели, guardrails AI, LLM safety filters, барьеры безопасности LLM
LLM Guardrails - набор механизмов, ограничивающих поведение языковой модели в рамках допустимого для конкретной системы. Они работают на двух уровнях: на входе - фильтруют запросы, блокируя попытки обойти ограничения или получить служебную информацию; на выходе - проверяют ответ перед отдачей, предотвращая утечку чувствительных данных и выход за пределы заданной области знаний. В агентных сценариях guardrails дополнительно контролируют, какие инструменты и действия модель вправе инициировать.
Статьи с этим термином · 3