Федеральное государственное бюджетное учреждение науки
«Санкт-Петербургский Федеральный исследовательский центр
Российской академии наук»

Обработка русскоязычных библиографических данных затруднена нестандартными форматами и отсутствием размеченных наборов данных. Разработана методика парсинга библиографических ссылок с использованием больших языковых моделей в режиме few-shot, которая позволяет извлекать структурированные элементы (авторы, название, издательство и др.) без необходимости создания больших аннотированных обучающих выборок. Предложенный подход на основе модели Llama 3.2 достиг значения F1-меры более 80% на русскоязычном датасете библиографических описаний произведений А.С. Пушкина, что демонстрирует его эффективность для языков с ограниченными ресурсами.

Данная разработка соответствует целям Стратегии научно-технологического развития Российской Федерации (Указ Президента РФ от 28.02.2024 г. № 145) по созданию технологий обработки больших данных для цифровизации науки и образования.

Kassab K., Teslya N. Parsing Bibliography Descriptions using Few-Shot Prompting with LLM // Proceedings of the 38th FRUCT Conference. 2025. P. 128–136. ISSN 2305-7254, https://fruct.org/files/publications/volume-38/fruct38/Kas.pdf