Модель для поиска научных текстов улучшили в Институте ИИ МГУ
Коллектив ученых из Института ИИ МГУ представил новую версию модели SciRus-tiny 3.5-zh – компактного и мощного текстового энкодера, специально разработанного для эффективного поиска в массивах научных текстов. В новой версии упор был сделан на улучшение архитектуры модели и повышение качества работы модели с текстами на китайском языке, а также на русско-китайском поиске. Для этого дополнительно был разработан и опубликован в открытом доступе бенчмарк zh-ruSciBench.
В современном мире объем научной информации растет экспоненциально, и навигация в этом океане знаний становится очень сложной задачей. Большие языковые модели, или LLM (Large Language Models), кардинально изменили подходы к обработке текстов, предлагая мощные инструменты для анализа, поиска и извлечения информации. Однако большинство флагманских LLM требуют колоссальных вычислительных мощностей как для обучения, так и для использования, что делает их недоступными для многих небольших исследовательских лабораторий и индивидуальных ученых. Во-вторых, несмотря на то, что научный дискурс глобален, значительная часть исследований публикуется на языках, отличных от английского. Существующие модели либо ориентированы преимущественно на английский язык, либо их многоязычные возможности ограничены, особенно когда речь идет о кросс-языковом поиске, например, между английским или китайским и русским.
Семейство моделей SciRus для получения эмбеддингов научных текстов разработано с фокусом на оптимальное соотношение качества работы, стоимости применения и поддержки кросс-язычного поиска. В домене научных текстов модели сравнимы по качеству с эмбеддерами, сильнейшими по международному бенчмарку MTEB, будучи в десятки и сотни раз меньше по количеству параметров. Модели успешно интегрированы в портал eLibrary.ru, улучшая качество поиска. Также, в рамках работы над SciRus, ведется разработка ряда бенчмарков для оценки языковых моделей для научных текстов. Были опубликованы в открытом доступе, помимо нового zh-ruSciBench, бенчмарк ruSciBench с широким спектром задач, многие из которых вошли в международный бенчмарк MTEB, а также ruSciFact, позволяющий оценить способность современных языковых моделей к проверке фактов.