Превращаю хаотичный мониторинг в управляемую надежность.
Помогаю компаниям внедрять SRE-практики, SLI/SLO и наблюдаемость без раздувания штата (Fractional SRE / SRE-консалтинг). Использую автоматизацию и AI, чтобы заменить «тушение пожаров» предсказуемыми процессами и сэкономить сотни часов инженерного времени.
Классические дашборды и метрики RED/USE часто не отвечают на главный вопрос: "Доволен ли пользователь и укладываемся ли мы в бизнес-требования?". Внедрение SLO с нуля кажется командам долгим и сложным процессом, а анализ инцидентов вручную съедает время команды.
Я закрываю этот разрыв: помогаю определить правильные SLI, настроить алертинг по Error Budget Burn Rate и внедряю AI-инструменты для ускорения реакции на сбои.
Я не только консультирую, но и разрабатываю инструменты, которые приносят измеримую пользу:
Разрабатываю концепцию бота для SRE-поддержки с использованием Retrieval-Augmented Generation. Идея: автоматизировать анализ сбоев и инцидентов в GitLab и Kubernetes, чтобы сократить MTTR за счет мгновенного извлечения контекста и исторических данных. Бот дает рекомендации по самостоятельному устранению или честно эскалирует на дежурного инженера с уже собранным контекстом.
flowchart LR
A["😫 Боль разработчика<br/>Сбой джобы, дайте доступ к бд"] --> B[" AI SRE Bot<br/>RAG + анализ логов"]
B --> C{"Решено?"}
C -->|Да| D["✅ Самостоятельное<br/>устранение"]
C -->|Нет| E[" Эскалация<br/>дежурному с контекстом"]
D --> F["📊 Метрики в Jira<br/>Deflection rate"]
E --> F
Схема работы бота: от боли разработчика до регистрации метрик в Jira. По умолчанию ответ считается успешным, если пользователь не вызывает бота повторно в треде (2-й вызов = эскалация на дежурного).
📦 slojka
Ready-to-go SLO bootstrap. Оптимизировал процесс создания и валидации кастомизированных спецификаций sloth.dev. Готовые шаблоны, генератор и дашборды Grafana позволяют начать работу с SLO за минуты, а не недели.
Стандартизация логирования на базе OpenTelemetry Logs Data Model (Vector.dev, ClickHouse, Ansible). Результат: время подключения нового источника логов в продакшен сократилось с 5 часов до 5–10 минут.
- Telegram-канал @allslo_ru — всё о SLO, SLI, Error Budget и наблюдаемости
- 👥 ALLSLO-COMMUNITY — Русскоязычное сообщество про SLI/SLO 📊, вопросы и решения, практический опыт сотен инженеров
- 🔧 sloth-next — развитие следующего поколения sloth.dev для работы с OpenSLO
- ✍️ 39 статей на Хабре (@r3code) о SRE, SLI/SLO, Error Budget, Vector.dev и ClickHouse.
- Спикер: DevOpsConf, Merge Baltic, Observability Conf, T-Meetup (доклады о быстром внедрении SLO и построении отказоустойчивых систем).
- 🧠 Член Программного комитета (ПК): DevOpsConf, Observability Conf.
- 🤝 Active Contributor в экосистему наблюдаемости:
sloth.dev,OpenSLO. - 🏢 Опыт: Более 5 лет построения и эксплуатации высоконагруженных систем (включая внедрение сервисной модели и SLO для Ceph в крупных финтех-проектах).
Я открыт для проектов в формате Fractional SRE, аудита надежности, настройки observability с нуля или менторства ваших инженеров.
- 💬 Обсудить задачу или аудит: Telegram @r3code
- 📚 Мои заметки и мысли о SRE и AI: Telegram-канал @letitkit
- 👥 AllSLO Community - все о SLO: Присоединиться в ТГ
- 🧑🏫 Индивидуальное менторство: GetMentor
- 📖 Читать статьи: Мой профиль на Хабре




