Перейти к содержимому
- Что такое трейсинг?
- Какие способы мониторинга производительности Go-приложения в продакшене вы знаете?
- Какие метрики вы записывали для ваших сервисов и почему?
- мониторинг и аналитика.
- При работе с микросервисами, как вы отслеживали ошибки, утечки памяти, перезапуски контейнеров и деградацию производительности?
- Работали ли вы с Grafana?
- На какие ключевые метрики и дашборды вы обращаете внимание в первую очередь?
- Работали ли вы с Loki?
- Какие уровни серьезности логов вы знаете?
- What metrics do you know about Prometheus?
- What ’s in a histogram?
- Which percentile is more accurate, 99th or 95th?
- Какие инструменты используешь для работы сервисов в проде?
- Было ли в рамках вашей деятельности полный этап от проектирования до разработки, мониторинга, сопровождения и так далее?
- Технические метрики: нагрузка. Кто за ними следил?
- Как правильно действовать чтобы понять причину проблем и выработать решения для улучшения ситуации?
- Работал ли с метриками производительности, например Prometheus? Если дa, что будешь логировать в первую очередь?
- Работал с трейсингом, если дa, то с каким?
- Вопрос: есть такой-то сервис с такой-то инфрой, и он начинает таймаутить. Как будешь выяснять причину?
- Как дебажить сервисы в кластере?
- Как в проекте определялся набор метрик и какие инструменты использовались для их сбора?
- Что вы использовали в качестве коллектора метрик для Prometheus?
- Как собирал метрики с Go сервисов?
- Как вы выставляли лимиты и пороги для метрик? Как настраивали алерты на основе этих лимитов?
- Приходилось ли вам участвовать в аварийном восстановлении сервиса на продакшене?
- Какие метрики вы считаете критичными для вашей системы? А в целом для backend-сервиса?
- Приходилось ли вам искать и устранять проблемы в работающих сервисах с помощью логов и метрик?
- Какие метрики вы отслеживали для анализа пользовательского поведения и просмотров?
- Что такое дисперсия и стандартное отклонение? Зачем они нужны при анализе метрик?
- Как вы настраивали алерты? Что делали с «шумными» алертами?
- Допустим, сервис начал тормозить. С чего начнешь разбираться и как найдешь узкое место?
- Какие метрики и трейсы для этого нужны, и что по ним будет видно - что тормозит: база, обработка данных или отдача ответа?
- Observability. Какие типы мониторинга знаешь в prometheus?
- Работал ли с прометеусом? Какие там есть типы метрик?
- Какие у вас обычно метрики были? Насколько ты в этом принимал участие, в настройке этих метрик?
- Способы поиска проблем производительности на проде?
- Достоинства и недостатки метрик?
- Типы метрик prometheus?
- Стандартный набор метрик prometheus в Go программе?
- Какие-то стандарты знаете для метрик?
- Что можете сказать про perf, eBPF, tcpdump?
- Что делает Sysmon?
- В продакшене выявлен проблемный API-эндпоинт со временем ответа 200 мс. Опишите ваш пошаговый план диагностики и оптимизации;
- По каким метрикам решать, нужен ли кэш?