Навыки
Нагрузка и надёжность
k6 · Locust · Gatling · JMeter · профили нагрузки (открытая и закрытая модель, coordinated omission) · capacity planning · soak / stress / spike / breakpoint · failover и RTO/RPO · chaos-эксперименты (гипотеза → инъекция → откат) · tc netem · stress-ng · SLI/SLO, бюджет ошибок, burn rate
Инфраструктура и CI
Kubernetes · Helm · Docker · Linux · GitLab CI · GitHub Actions · AWS · GCP · Azure · провиженинг через Bash и облачные CLI
Observability
Grafana · Victoria Metrics · Prometheus-стек · ELK — от развёртывания кластера до расследования инцидентов и деградаций
Языки
Python (Locust-сценарии, агент хаоса, анализ отчётов) · Go · Bash · TypeScript · SQL (PostgreSQL)
AI / LLM
Anthropic SDK · OpenAI SDK · Ollama · ChromaDB · RAG · MCP · Claude Code
Честные границы
Разделяю то, что делал в проде, и то, что знаю по своей лаборатории. На собеседовании по надёжности первый же вопрос — «расскажи конкретный эксперимент», поэтому список ниже написан так, как есть.
- Chaos Mesh и Litmus — знаю по лаборатории и курсу, в проде не применял. Хаос на работе делал руками: kubectl delete и drain, kill процесса, iptables, stress-ng.
- tc netem и Toxiproxy — в лаборатории. iptables DROP — на работе.
- Locust и Gatling — сценарии писал в лаборатории; на рабочих проектах основной инструмент k6, раньше JMeter.
- SLI/SLO формально не вводил: работал с SLA заказчиков как с порогами. Бюджет ошибок и burn rate считал в своих калькуляторах.
- Постмортемы писал как разборы по результатам провальных тестов и инцидентов, не по blameless-шаблону.