Preskočiť na obsah
  • O nás
    • Kto sme a ako sa stať naším členom?
    • Stanovy spoločnosti
    • Predseda a správna rada
    • Kontakt
  • Oznamy
  • Politika
  • Kultúra a veda
    • Kultúrne novinky v slovenskom jazyku
    • Vedecké novinky v ruskom jazyku
  • Pel-mel
  • Kluby Arbat
  • Komentáre
  • O nás
    • Kto sme a ako sa stať naším členom?
    • Stanovy spoločnosti
    • Predseda a správna rada
    • Kontakt
  • Oznamy
  • Politika
  • Kultúra a veda
    • Kultúrne novinky v slovenskom jazyku
    • Vedecké novinky v ruskom jazyku
  • Pel-mel
  • Kluby Arbat
  • Komentáre
Источник фото: Hermann Traub / Pixabay

Správa z oblasti ruskej vedy v pôvodnom znení (scientificrussia.ru)

  • srspol
  • 5. januára, 2026
  • 11:32 pm

Модель для поиска научных текстов улучшили в Институте ИИ МГУ


Коллектив ученых из Института ИИ МГУ представил новую версию модели SciRus-tiny 3.5-zh – компактного и мощного текстового энкодера, специально разработанного для эффективного поиска в массивах научных текстов. В новой версии упор был сделан на улучшение архитектуры модели и повышение качества работы модели с текстами на китайском языке, а также на русско-китайском поиске. Для этого дополнительно был разработан и опубликован в открытом доступе бенчмарк zh-ruSciBench.

В современном мире объем научной информации растет экспоненциально, и навигация в этом океане знаний становится очень сложной задачей. Большие языковые модели, или LLM (Large Language Models), кардинально изменили подходы к обработке текстов, предлагая мощные инструменты для анализа, поиска и извлечения информации. Однако большинство флагманских LLM требуют колоссальных вычислительных мощностей как для обучения, так и для использования, что делает их недоступными для многих небольших исследовательских лабораторий и индивидуальных ученых. Во-вторых, несмотря на то, что научный дискурс глобален, значительная часть исследований публикуется на языках, отличных от английского. Существующие модели либо ориентированы преимущественно на английский язык, либо их многоязычные возможности ограничены, особенно когда речь идет о кросс-языковом поиске, например, между английским или китайским и русским.

Семейство моделей SciRus для получения эмбеддингов научных текстов разработано с фокусом на оптимальное соотношение качества работы, стоимости применения и поддержки кросс-язычного поиска. В домене научных текстов модели сравнимы по качеству с эмбеддерами, сильнейшими по международному бенчмарку MTEB, будучи в десятки и сотни раз меньше по количеству параметров. Модели успешно интегрированы в портал eLibrary.ru, улучшая качество поиска. Также, в рамках работы над SciRus, ведется разработка ряда бенчмарков для оценки языковых моделей для научных текстов. Были опубликованы в открытом доступе, помимо нового zh-ruSciBench, бенчмарк ruSciBench с широким спектром задач, многие из которых вошли в международный бенчмарк MTEB, а также ruSciFact, позволяющий оценить способность современных языковых моделей к проверке фактов.

Остальную часть статьи можно найти на сайте «Научная Россия» (scientificrussia.ru)
PrevPredchádzajúca správaAlena Kratochvílová: Pád Madura srazí ruskou ropu. Problémy pro Kreml. Oligarcha popsal své obavy
Ďalšia správaTrump dal vzor Číně pro operaci Tchaj-wan?Ďalšie
  • Kto sme a ako sa stať naším členom?
  • Stanovy občianskeho združenia
  • Predseda a správna rada
  • Kontakt
  • Oznamy
  • Politika
  • Kultúra a veda
  • Kultúrne novinky v slovenskom jazyku
  • Vedecké novinky v ruskom jazyku
  • Pel-mel
  • Kluby Arbat
  • Komentáre

© Slovensko-ruská spoločnosť. Všetky práva vyhradené.

Spravujte súhlas so súbormi cookie
Na poskytovanie tých najlepších skúseností používame technológie, ako sú súbory cookie na ukladanie a/alebo prístup k informáciám o zariadení. Súhlas s týmito technológiami nám umožní spracovávať údaje, ako je správanie pri prehliadaní alebo jedinečné ID na tejto stránke. Nesúhlas alebo odvolanie súhlasu môže nepriaznivo ovplyvniť určité vlastnosti a funkcie.
Funkčné Vždy aktívny
Technické uloženie alebo prístup sú nevyhnutne potrebné na legitímny účel umožnenia použitia konkrétnej služby, ktorú si účastník alebo používateľ výslovne vyžiadal, alebo na jediný účel vykonania prenosu komunikácie cez elektronickú komunikačnú sieť.
Predvoľby
Technické uloženie alebo prístup je potrebný na legitímny účel ukladania preferencií, ktoré si účastník alebo používateľ nepožaduje.
Štatistiky
Technické úložisko alebo prístup, ktorý sa používa výlučne na štatistické účely. Technické úložisko alebo prístup, ktorý sa používa výlučne na anonymné štatistické účely. Bez predvolania, dobrovoľného plnenia zo strany vášho poskytovateľa internetových služieb alebo dodatočných záznamov od tretej strany, informácie uložené alebo získané len na tento účel sa zvyčajne nedajú použiť na vašu identifikáciu.
Marketing
Technické úložisko alebo prístup sú potrebné na vytvorenie používateľských profilov na odosielanie reklamy alebo sledovanie používateľa na webovej stránke alebo na viacerých webových stránkach na podobné marketingové účely.
Spravovať možnosti Správa služieb Spravovať predajcov Prečítajte si viac o týchto účeloch
Zobraziť predvoľby
{title} {title} {title}