SRE
Также: SRE, site reliability engineering, инженерия надёжности, SRE-практики
SRE (Site Reliability Engineering) - дисциплина применения программной инженерии к задачам эксплуатации, разработанная в Google. Вместо ручного обслуживания SRE-команды автоматизируют рутинную работу (toil) и управляют надёжностью через измеримые метрики: SLI (индикатор уровня сервиса) фиксирует реальное поведение, SLO (целевой уровень) задаёт допустимую границу, а error budget определяет, сколько сбоев допустимо - это помогает балансировать скорость разработки и стабильность системы.
Статьи с этим термином · 4
- Grafana 10.4: новый интерфейс алертов и работа с Loki без боли · 16 апреля 2024
- Итоги 2019 года: Kubernetes в зрелом проде, CentOS 8, суверенный рунет и нарастающая регуляторика · 25 декабря 2019
- Error budget в ретейле: как нарушения SLO за две недели убедили заказчика в canary · 7 августа 2019
- SLO на Prometheus: первый error budget и что он нам показал · 15 июля 2019