Релиз рискован
Выкатка руками, откат нигде не описан, всё держится на одном человеке. Вопрос не в том, что плохо, а с чего начинать.
Ведущий инженер по инфраструктуре и надёжности — на часть занятости
Разбираюсь, где инфраструктура и серверная часть создают риск для продукта, и помогаю выбрать, за что браться первым. Работаю руками, результат остаётся у вашей команды.
Для продуктовых компаний со своей разработкой, у которых задачи по инфраструктуре уже есть, а отдельного сильного инженера под них пока нет.
Когда полезен
Выкатка руками, откат нигде не описан, всё держится на одном человеке. Вопрос не в том, что плохо, а с чего начинать.
Копии снимаются, оповещения приходят. А вот проверял ли кто-нибудь, что восстановление вообще отработает, — обычно выясняется в худший момент.
Инфраструктура усложняется быстрее, чем растёт команда. Перед переездом или следующим этапом стоит разобрать границы, зависимости и то, как это эксплуатируется.
Услуги
Выбираем один вопрос и согласованную выборку систем. Объём, исключения, результаты, сроки и стоимость фиксируем до начала работы.
Где инфраструктура и доставка изменений создают риск для продукта?
Первый проектОтчёт, короткая выжимка для руководства и разбор с командой
Какие сценарии отказа влияют на пользователей и как расставить приоритеты?
Первый проектПлан надёжности с ответственными и зависимостями
Реализовать одно выбранное улучшение после согласования приоритетов.
Следующий этапФиксированная стоимость за согласованный результат
Диагностика идёт с доступом только на чтение. Внедрение и активные проверки согласуются отдельно. Если потребность окажется регулярной, договариваемся о постоянном участии с оговорённым месячным объёмом. Круглосуточного дежурства не предлагаю ни в одном варианте.
Опыт
Больше 13 лет в разработке и эксплуатации: серверная часть на Go и Python, платформы, надёжность, инфраструктура в облаке и на своём железе. Разговор, работу и передачу результата веду сам — субподрядчиков и стажёров в проекте не будет.
Kubernetes, инфраструктура как код, сборка и доставка изменений, PostgreSQL, очереди сообщений, наблюдаемость и восстановление. Инструмент выбирается под задачу и под то, что команда сможет поддерживать дальше сама.
Связь с железом на Go, аренда и платежи на Python, между ними очередь событий. Плюс двойник шлюза, чтобы ловить сбои связи не на объекте.
Как это устроеноНадёжность собрана ступенями: вторая копия базы, пул соединений и журналы подключаются отдельными слоями, когда до них дорастают.
Как это устроеноВесь парк стендов описан одной переменной, список хостов для Ansible собирается сам. Ручной перенос адресов исчез.
Как это устроеноЭто собственные продукты и внутренняя автоматизация. Клиентские проекты под соглашением о неразглашении я не показываю.
Как работаем
За 30 минут уточняем проблему, срочность, владельца и ограничения. Выбираем один следующий шаг.
Фиксируем выборку, исключения, результаты, стоимость и критерии приёмки. Отдельно указываем трудозатраты и календарные даты.
После согласования условий старта определяем роли, доступы и исходные данные. Неизвестное отмечаем явно.
Собираем подтверждения, обсуждаем риски и решения. Еженедельно сообщаю статус; новые задачи согласуем отдельно.
Разбираем отчёт и план, передаём материалы, подписываем приёмку и закрываем доступы. Внедрение — отдельный этап.
Один основной проект одновременно. Цена и даты зависят от согласованного объёма и доступности команды. Условия договора и оплаты определяются для конкретного проекта.
Контакт
Напишите, что за продукт, что мешает команде и почему вопрос возник сейчас. Не отправляйте секреты, доступы или данные пользователей.
Первый разговор — 30 минут для уточнения задачи. Технический разбор и архитектурные рекомендации входят в согласованную платную работу.
После разговора у вас будет конкретный следующий шаг: ограниченная диагностика, внедрение одного улучшения или совет вернуться к этому позже. Третий вариант звучит чаще, чем принято признавать.