Найти
Результаты поиска
Найден один результат.
1 - 1 из 1 результатов
Задача автоматического извлечения причинно-следственных связей (ПСС) критически важна для систем поддержки решений, но ее развитие сдерживается дефицитом размеченных корпусов. Цель исследования – сравнительный анализ эффективности трёх типов обучающих данных: открытых экспертных корпусов, реального политического корпуса с ручной разметкой и синтетических данных, генерируемых большой языковой моделью. Эксперименты выполнены на архитектуре DistilBERT с пословной разметкой по схеме BIOES. Синтетические данные генерировались LLM Llama-3 с инкапсуляцией причин и следствий в XML-маркеры и последующей детерминированной конвертацией в формат BIOES. Для сравнения использованы два экспертных корпуса (EventStoryLine, SemEval-2010 Task 8), экспертно размеченный политический корпус PolitiCAUSE и синтетическая выборка объёмом 1100 сбалансированных примеров. Модель, обученная на синтетических данных, достигла Macro F1 = 0,736, что на 6,7% выше результата модели, обученной на экспертных корпусах (0,690). Обучение на политическом корпусе PolitiCAUSE (24417 примеров) дало существенно более низкий результат - Macro F1 = 0,367. Данное расхождение обусловлено дисбалансом классов (около 15% каузальных токенов против 50% в синтетической выборке) и различием в постановке задачи: PolitiCAUSE ориентирован на бинарную классификацию наличия каузальности в предложении, тогда как в настоящей работе выполняется разметка спанов. Подтверждена гипотеза о приоритете качества и баланса аннотаций над объёмом данных. Предложенный пайплайн LLM-генерации позволяет создавать обучающие выборки, превосходящие по эффективности экспертные корпуса, при отсутствии прямых затрат на ручную аннотацию. Метод рекомендован для быстрого развёртывания систем извлечения каузальных отношений в новых предметных областях