Переполнение диска данными мониторинга
Описание проблемы:
Быстрое заполнение диска при установке standalone или для кластерной установки, на узле кластера с ролью co_infra.
Решение:
Быстрое заполнение диска может происходить при поступлении большого количества данных мониторинга или логирования, из-за неправильно настроенных политик их хранения.
По умолчанию данные мониторинга располагаются в директории /srv/docker/prometheus/data. Время хранения данных задается при установке CO с помощью переменной prometheus_storage_tsdb_retention_time (по умолчанию "21d", то есть 21 день).
При переполнении диска данными мониторинга база данных Prometheus может быть повреждена. Для восстановления работоспособности необходимо удалить директорию /srv/docker/prometheus/data. После удаления директории следует переустановить роль, ограничив ее опцией -limit, только для роли co_infra и указав сценарий playbooks/infra.yml. Пример команды:
ansible-playbook -i playbooks/infra.yml -–tags prometheus -–limit co_infra
Объем данных журнала событий зависит от количества узлов кластера, количества их контейнеров и уровня протоколирования различных сервисов (настраиваются с помощью Etcd). По умолчанию данные журнала событий располагаются в директории /srv/docker/elasticsearch/data. Время хранения данных задается при установке CO с помощью переменной co_logs_retention_days в файле ~/install_co/group_vars/all/main.yml. Значение по умолчанию "120d", что означает — 120 дней.
В случае переполнения диска данными журнала событий, предусмотрено удаление более старые индексов вручную (структуры хранения и поиска данных в объеме 1 дня). Для этого на узле с ролью co_infra необходимо выполнить следующие команды:
# пароль вводить из переменной elasticsearch_opendistro_admin_password
curl -k --user admin https://localhost:9200/_cat/indices
# выбрать индексы, подлежащие удалению, начинающиеся с "co-"
curl -X DELETE -k --user admin https://localhost:9200/co-<YYYY.MM.DD>
Для уменьшения уровня логирования необходимо изменить значения переменных, приведенных в таблице.
| Наименование переменной | Значение по умолчанию | Значение для уменьшения глубины лога |
|---|---|---|
| common_co_log_level | info | warn/error |
| chatbot_log_level | info | warn/error |
| cvm_cu_log_level | info | warn/error |
| cvm_log_level | info | warn/error |
| dcm_du_log_level | info | warn/error |
| dcm_log_level | info | warn/error |
| du_log_level | info | warn/error |
| du_nps_log_level | info | warn/error |
| fm_log_level | info | warn/error |
| sdd_log_level | info | warn/error |