Skip to main content

Переполнение диска данными мониторинга

Описание проблемы:​

Быстрое заполнение диска при установке standalone или для кластерной установки, на узле кластера с ролью co_infra.

Решение:​

Быстрое заполнение диска может происходить при поступлении большого количества данных мониторинга или логирования, из-за неправильно настроенных политик их хранения.

По умолчанию данные мониторинга располагаются в директории /srv/docker/prometheus/data. Время хранения данных задается при установке CO с помощью переменной prometheus_storage_tsdb_retention_time (по умолчанию "21d", то есть 21 день).

При переполнении диска данными мониторинга база данных Prometheus может быть повреждена. Для восстановления работоспособности необходимо удалить директорию /srv/docker/prometheus/data. После удаления директории следует переустановить роль, ограничив ее опцией -limit, только для роли co_infra и указав сценарий playbooks/infra.yml. Пример команды:

ansible-playbook -i playbooks/infra.yml -–tags prometheus -–limit co_infra

Объем данных журнала событий зависит от количества узлов кластера, количества их контейнеров и уровня протоколирования различных сервисов (настраиваются с помощью Etcd). По умолчанию данные журнала событий располагаются в директории /srv/docker/elasticsearch/data. Время хранения данных задается при установке CO с помощью переменной co_logs_retention_days в файле ~/install_co/group_vars/all/main.yml. Значение по умолчанию "120d", что означает — 120 дней.

В случае переполнения диска данными журнала событий, предусмотрено удаление более старые индексов вручную (структуры хранения и поиска данных в объеме 1 дня). Для этого на узле с ролью co_infra необходимо выполнить следующие команды:

# пароль вводить из переменной elasticsearch_opendistro_admin_password
curl -k --user admin https://localhost:9200/_cat/indices
# выбрать индексы, подлежащие удалению, начинающиеся с "co-"
curl -X DELETE -k --user admin https://localhost:9200/co-<YYYY.MM.DD>

Для уменьшения уровня логирования необходимо изменить значения переменных, приведенных в таблице.

Наименование переменнойЗначение по умолчаниюЗначение для уменьшения глубины лога
common_co_log_levelinfowarn/error
chatbot_log_levelinfowarn/error
cvm_cu_log_levelinfowarn/error
cvm_log_levelinfowarn/error
dcm_du_log_levelinfowarn/error
dcm_log_levelinfowarn/error
du_log_levelinfowarn/error
du_nps_log_levelinfowarn/error
fm_log_levelinfowarn/error
sdd_log_levelinfowarn/error