Найти
Результаты поиска
-
НОВАЯ МЕТРИКА ВОСПРОИЗВОДИМОСТИ ДЛЯ СРАВНЕНИЯ КЛАССИФИКАТОРОВ ВРЕМЕННЫХ РЯДОВ
М. О. Доброхвалов , А.Ю. Филатов , Е.А. Чегодаева2026-02-27Аннотация ▼Воспроизводимость результатов экспериментов является критическим аспектом современного машинного обучения, однако выбор случайного инициализирующего сида существенно влияет на итоговое качество моделей, что создает проблему корректного сравнения различных архитектур и методов. Цель исследования заключалась в оценке влияния выбора случайного сида на результаты классификации временных рядов сверточными нейросетями и в разработке корректного способа сравнения моделей. Задачи включали измерение разброса метрик при множественных повторных запусках в рамках варьирующихся инициализаций, проверку нормальности распределений, введение метаметрики воспроизводимости RM и подбор ее параметра λ, а также проверку переносимости подхода на альтернативных архитектурах. Проведены эксперименты с двумя одномерными архитектурами (FCN, ResNet) сверточных нейронных сетей на семи открытых наборах данных временных рядов разной природы. Для каждой пары модель–датасет выполнено по 55 независимых запусков с фиксацией источников случайности и идентичными настройками обучения в PyTorch. Статистический анализ включал критерии Шапиро Уилка и Андерсона Дарлинга. Показано, что распределения аккуратности чаще всего не соответствуют нормальному закону, поэтому интервальные оценки, основанные на нормальности, некорректны. Варьирование сида приводит к различиям аккуратности до 12 процентных пунктов, причем величина разброса зависит от датасета и архитектуры. Предложенная метрика воспроизводимости (RM), штрафующая за дисперсию, при малом числе запусков на различных инициализирующих значениях приближает нижнюю наблюдаемую границу, при большом числе стремится к среднему. Предложенная RM позволяет сравнивать модели с учетом случайных “удачных” и “неудачных” инициализаций и ранжировать модели по устойчивости, задает стандарт отчетности, повышающий воспроизводимость экспериментов и надежность выводов. Эмпирическая проверка на архитектуре DenseNet подтвердила, что RM адекватно реагирует как на стабильные, так и на нестабильные наборы. Методика легко переносится на новые датасеты и архитектуры. Предложенная метрика может быть использована для стандартизации отчётности и повышения воспроизводимости исследований.








