АЛГОРИТМЫ АГЛОМЕРАТИВНОЙ КЛАСТЕРИЗАЦИИ ПРИМЕНИТЕЛЬНО К ЗАДАЧАМ АНАЛИЗА ЛИНГВИСТИЧЕСКОЙ ЭКСПЕРТНОЙ ИНФОРМАЦИИ
Аннотация
Рассмотрены и представлены основные проблемы и принципы функционирования процесса кластеризации данных, в частности принципы и задачи кластеризации тексто- вых массивов лингвистической экспертной информации. В ходе выполнения данной работы были обозначены основные трудности возникающие при проектировании подобного рода систем, например: необходимость предварительной обработки данных, сокращение раз- мерности исходной выборки и т.п. Для эффективного выполнения представленных задач реализованное решение должно обладать комплексным подходом учитывающим показате- ли эффективности методов направленных на решение отдельных подзадач, а также спо- собностью обеспечить высокие показатели эффективности реализации каждого этапа процесса кластеризации. В представленной работе рассматриваются различные группы алгоритмов иерархической кластеризации, в частности была рассмотрена подгруппа ал- горитмов агломеративной кластеризации применительно к задачам кластеризации лин- гвистической экспертной информации. В описываемой работе приведена формальная по- становка задачи кластеризации текстов, а также определена основная группа реализо- ванных решений основанных на принципах агломеративной кластеризации: ROCK, CURE, CHAMELEON. Проведен детальный обзор каждого из представленных алгоритмов, а также сформулированы основные достоинства и недостатки каждого из них. Преимуще- ством данной работы можно считать совокупность представленных данных об алгорит- мах, а также результаты сравнительного анализа, позволяющие в дальнейшем оценить целесообразность и потенциальную вероятность применения указанных решения из пред- ставленной группы алгоритмов агломеративной кластеризации. Новизна данной работы заключается в формировании обзорного анализа существующих подходов в области иерар- хической кластеризации для решения задач кластерного анализа лингвистической эксперт- ной информации, а также формирование результатов проведенного сравнительного ана- лиза рассмотренных алгоритмов








