В Україні створили рейтинг ШІ-моделей — оцінюють, як добре вони знають українську
В Україні запустили платформу, де порівнянюють великі мовні моделі за якістю роботи з українською мовою — Ukrainian LLM Leaderboard.
Про це повідомляють у Мінцифри. Результати тестування, код і дані відкрили на платформі Hugging Face — онлайн-сервісі для розробників, дослідників і користувачів, де зберігають, поширюють і тестують моделі штучного інтелекту та набори даних. Користувачі можуть самостійно порівнювати моделі та ознайомлюватися з методологією оцінювання.
Таблиця з результатами тестування конкретних моделей. Скриншот з Hugging Face
Автори проєкту кажуть, що досі розробникам доводилося орієнтуватися переважно на міжнародні тести та заяви самих компаній-розробників. Українську мову в таких тестах часто оцінювали через машинний переклад, тому реальні помилки моделей могли залишатися непомітними.
Платформа перевіряє моделі на завданнях, наближених до реального використання: перекладі, переказі та стислому викладі текстів, пошуку інформації в документах, логічних задачах, математиці та тестах на рівні ЗНО.
«Після появи великих мовних моделей було незрозуміло, як добре вони працюють для української мови: які їхні сильні та слабкі сторони, для яких завдань які моделі краще підходять, де досі є прогалини в якості роботи з українською», — каже аспірант УКУ та керівник розробки мовної моделі Lapa Юрій Панів.
Рейтинг показує результати моделей не за одним показником, а за окремими тестами. Наприклад, модель може добре впоратися з питаннями українською, але показати гірший результат у перекладі.
Надалі команда планує додати тести для роботи із зображеннями, оцінювання етичності моделей та аналіз вартості їхнього використання українською. Окремо хочуть перевіряти моделі на роботі з адміністративними процедурами, нормативними текстами та персональними даними.
Платформу створили Центр компетенцій WINWIN AI при Мінцифрі спільно з УКУ та ініціативою lang-uk.