Найти
Результаты поиска
Найден один результат.
1 - 1 из 1 результатов
Основное внимание уделяется подходам преодоления системных ограничений парадигмы масштабирования больших языковых моделей (LLM), связанных с исчерпанием данных и экспоненциальным ростом вычислительных затрат. Обход таких ограничений позволяет разработать более эффективные подходы к созданию NLP-моделей без потери в качестве их работы. Целью данного исследования является сравнительный анализ эффективности стандартной трансформерной архитектуры (nanoGPT) и модели, оперирующей семантическими эмбеддингами (nanoSonar), для задач языкового моделирования в условиях ограниченных ресурсов. Работа с концептуальными эмбеддингами позволяет выявить более глубокие языковые закономерности и сократить объем требуемых данных для обучения, что значительно повышает эффективность моделирования. При проведении исследования использовался набор данных TinyStories, который включает короткие нарративы с четкой структурой. Перед реализацией моделей была проведена предобработка данных: для nanoGPT – токенизация методом BPE, для nanoSonar – преобразование текста в семантические эмбеддинги с помощью предобученной модели Sonar. Оценка моделей осуществлялась с использованием метрик функции потерь (loss) и перплексии (perplexity). Результаты исследования показали, что модель nanoSonar обеспечивает значительно более низкую перплексию (6,609 против 39,151 у nanoGPT), а также демонстрирует более устойчивую динамику обучения на поздних этапах. В работе представлен анализ современных подходов к оптимизации масштабирования (MoE, дистилляция, PEFT) и перспективных архитектур (LRM, SSM, RWKV), а также даны практические рекомендации по применению моделей, работающих в пространстве семантических эмбеддингов, для доменно-специфичных задач и систем с ограниченными вычислительными ресурсами. Результаты исследования могут быть полезны при разработке эффективных языковых моделей, сочетающих высокое качество генерации с экономичной архитектурой.