Перейти к основному контенту Перейти к главному меню навигации Перейти к нижнему колонтитулу сайта
##common.pageHeaderLogo.altText##
Известия ЮФУ
Технические науки
  • Текущий выпуск
  • Предыдущие выпуски
    • Архив
    • Выпуски 1995 – 2019
  • Редакционный совет
  • О журнале
    • Официально
    • Основные задачи
    • Основные рубрики
    • Специальности ВАК РФ
    • Главный редактор
ISSN 1999-9429 print
ISSN 2311-3103 online
  • Вход
  1. Главная /
  2. Найти

Найти

Расширенные фильтры
Опубликовано после
Опубликовано до

Результаты поиска

Найден один результат.
  • АЛЬТЕРНАТИВНЫЕ ПОДХОДЫ К МАСШТАБИРОВАНИЮ NLP МОДЕЛЕЙ: АНАЛИЗ ПОДХОДОВ К ОПТИМИЗАЦИИ ОБЪЕМА ДАННЫХ И ВЫЧИСЛЕНИЙ ПРИ ОБУЧЕНИИ БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ

    К.И. Ралко , Н. Е. Сергеев
    152-172
    2026-07-07
    Аннотация ▼

    Основное внимание уделяется подходам преодоления системных ограничений парадигмы масштабирования больших языковых моделей (LLM), связанных с исчерпанием данных и экспоненциальным ростом вычислительных затрат. Обход таких ограничений позволяет разработать более эффективные подходы к созданию NLP-моделей без потери в качестве их работы. Целью данного исследования является сравнительный анализ эффективности стандартной трансформерной архитектуры (nanoGPT) и модели, оперирующей семантическими эмбеддингами (nanoSonar), для задач языкового моделирования в условиях ограниченных ресурсов. Работа с концептуальными эмбеддингами позволяет выявить более глубокие языковые закономерности и сократить объем требуемых данных для обучения, что значительно повышает эффективность моделирования. При проведении исследования использовался набор данных TinyStories, который включает короткие нарративы с четкой структурой. Перед реализацией моделей была проведена предобработка данных: для nanoGPT – токенизация методом BPE, для nanoSonar – преобразование текста в семантические эмбеддинги с помощью предобученной модели Sonar. Оценка моделей осуществлялась с использованием метрик функции потерь (loss) и перплексии (perplexity). Результаты исследования показали, что модель nanoSonar обеспечивает значительно более низкую перплексию (6,609 против 39,151 у nanoGPT), а также демонстрирует более устойчивую динамику обучения на поздних этапах. В работе представлен анализ современных подходов к оптимизации масштабирования (MoE, дистилляция, PEFT) и перспективных архитектур (LRM, SSM, RWKV), а также даны практические рекомендации по применению моделей, работающих в пространстве семантических эмбеддингов, для доменно-специфичных задач и систем с ограниченными вычислительными ресурсами. Результаты исследования могут быть полезны при разработке эффективных языковых моделей, сочетающих высокое качество генерации с экономичной архитектурой.

1 - 1 из 1 результатов

links

Для авторов
  • Подать статью
  • Требования к рукописи
  • Редакционная политика
  • Рецензирование
  • Этика научных публикаций
  • Политика открытого доступа
  • Сопроводительные документы
Язык
  • English
  • русский

journal

* не является рекламой

index

Индексация журнала
* не является рекламой
Информация
  • Для читателей
  • Для авторов
  • Для библиотек
Адрес редакции: 347900, г. Таганрог, ул. Чехова, д. 22, А-211 Телефон: +7 (8634) 37-19-80 Электронная почта: iborodyanskiy@sfedu.ru
Публикация в журнале бесплатна
Больше информации об этой издательской системе, платформе и рабочем процессе от OJS/PKP.
logo Сайт разработан командой ЦИИР