Найти
Результаты поиска
##search.searchResults.foundPlural##
1 - 2 из 2 результатов
Задача автоматического извлечения причинно-следственных связей (ПСС) критически важна для систем поддержки решений, но ее развитие сдерживается дефицитом размеченных корпусов. Цель исследования – сравнительный анализ эффективности трёх типов обучающих данных: открытых экспертных корпусов, реального политического корпуса с ручной разметкой и синтетических данных, генерируемых большой языковой моделью. Эксперименты выполнены на архитектуре DistilBERT с пословной разметкой по схеме BIOES. Синтетические данные генерировались LLM Llama-3 с инкапсуляцией причин и следствий в XML-маркеры и последующей детерминированной конвертацией в формат BIOES. Для сравнения использованы два экспертных корпуса (EventStoryLine, SemEval-2010 Task 8), экспертно размеченный политический корпус PolitiCAUSE и синтетическая выборка объёмом 1100 сбалансированных примеров. Модель, обученная на синтетических данных, достигла Macro F1 = 0,736, что на 6,7% выше результата модели, обученной на экспертных корпусах (0,690). Обучение на политическом корпусе PolitiCAUSE (24417 примеров) дало существенно более низкий результат - Macro F1 = 0,367. Данное расхождение обусловлено дисбалансом классов (около 15% каузальных токенов против 50% в синтетической выборке) и различием в постановке задачи: PolitiCAUSE ориентирован на бинарную классификацию наличия каузальности в предложении, тогда как в настоящей работе выполняется разметка спанов. Подтверждена гипотеза о приоритете качества и баланса аннотаций над объёмом данных. Предложенный пайплайн LLM-генерации позволяет создавать обучающие выборки, превосходящие по эффективности экспертные корпуса, при отсутствии прямых затрат на ручную аннотацию. Метод рекомендован для быстрого развёртывания систем извлечения каузальных отношений в новых предметных областях
Рассматривается проблема разработки модели извлечения полных причинных кортежей из
неструктурированных текстов для представления ситуаций принятий решений в сложных социо-
гуманитарных средах. Совокупность извлекаемых кортежей из определенного набора текстов
представляет собой связанные сущности конкретной среды, что позволяет создать причинно-
следственные графы. В этой статье предлагается модель извлечения причинно-следственных
связей с использованием предобученной модели BERT с дообучением на основе дополнительных
признаков. Для уточнения причинной классификации модель использует два вида признаков (кау-
зальность глаголов и метрики качества причинного влияния) для распознавания причинного кор-
тежа, автоматически изучает семантические признаки из предложений, повышая точность из-
влечения. Предварительная обработка текста осуществляется с помощью библиотеки SpaCy с
открытым исходным кодом. Извлеченные причинно-следственные кортежи в формате <фраза
причины, фраза глагола, фраза следствия, полярность> легко трансформируется в соответст-
вующие элементы графа <исходящий узел, направление связи, входящий узел, знак веса связи> и
далее могут быть использованы для построения направленного взвешенного знакового графа с
детерминированной причинностью на дугах. В целях снижения зависимости от внешних знаний
для дообучения и тестирования модели BERT используются синтетически сгенерированные анно-
тированые наборы данных. Экспериментальные результаты показывают, что точность извлече-
ния причинно-следственных связей на синтетических данных достигает 94%, а значение
F1 – 95%. Преимуществами представленного технологического решения является то, что модель
не требует высоких эксплуатационных затрат, реализована на компьютере со стандартными
характеристиками, использует свободное программное обеспечение, что делает ее доступной для
широкого круга пользователей. Ожидается, что предложенная модель может быть использована
для автоматизации анализа текстов и поддержки принятия решений в условиях высокой неопре-
деленности, что особенно актуально для социогуманитарных сред.