Чому Gemma знає українську краще за інших та коли лусне бульбашка LLM. Інтерв’ю з керівником LapaLLM
ChatGPT та інші популярні сервіси все ще плутаються в українській граматиці та контексті. Тож група волонтерів створила проєкт LapaLLM. Вони вже навчили
Керівник проєкту та аспірант УКУ Юрій Панів розповів DOU, яка модель зараз найкраще розуміє українську, чому серед моделей у їхньому лідерборді немає закритих API-рішень, що він думає про проєкт «Сяйво» від Мінцифри та «Київстару», а також які перспективи професії

Як розвивається LapaLLM і чому в бенчмарках немає Anthropic
— Торік ми писали про LapaLLM: велика мовна модель, з нуля адаптована для роботи з українською мовою. Що змінилося останнім часом і скільки людей зараз залучено до розробки?
Це волонтерський проєкт, тож у різні періоди до проєкту долучалися різні люди. Нині ми шукаємо гранти для першої оплачуваної когорти дослідників українського NLP (Natural Language Processing).
Поштовх дав проєкт lang-uk, співзасновником якого є Дмитро Чаплинський — мій колега, з яким ми маємо кілька спільних статей. Коли він разом із Денисом Бігусом (український журналіст-розслідувач — ред.) створював сервіс для аналізу декларацій чиновників, знадобилося аналізувати великий масив документів і знаходити взаємозв’язки між ними. Тож приблизно з 2014 року ми почали розробляти NLP-інструменти для обробки української мови. Дмитро брав участь у розробці попередньої ітерації LapaLLM.
Зараз до проєкту залучено 13 людей. Ми натренували
Ми отримали доступ до суперкомп’ютера JUPITER із відеокартами GH200 (близько 120 ГБ відеопам’яті кожна) — 5000 нод-годин на ноді з чотирма картками.

Для розробки LLM потрібна велика кількість обчислювальних ресурсів. Завдяки програмі EuroHPC ми отримали доступ до передових відеокарт, на яких можемо нормально працювати. До українських суперкомпʼютерів у нашої команди немає доступу.
Це розробницький етап: ми готуємо всі скрипти, щоб згодом запустити повноцінне тренування більшої моделі, а на основі отриманих результатів плануємо подаватися на більший обсяг обчислень. Хотілося б отримати мільйони нод-годин і мати найбільший обчислювальний ресурс в Україні для тренування такої великої моделі.
Але, як любить казати Дмитро, моделі приходять і йдуть, а датасет залишається. Особисто я вважаю найбільшим результатом нашого лідерборду можливість подивитися, які моделі найкраще, а які найгірше працюють з українською мовою, і знайти відповідні датасети. Ми відкрили більшість даних для тренування, тож інші дослідники можуть використати їх і побачити, як усе це відтренувати самостійно. Код теж відкритий.

— У цьому лідерборді немає продуктів Anthropic. Чому?
Щоб прогнати бенчмарки, потрібно дуже багато промптів, і прогонів має бути декілька. Орієнтовна вартість одного прогону лише для однієї API-моделі — близько
Отримавши грант, ми плануємо прогнати бенчмарки для більшості наявних моделей — до трьох трильйонів параметрів, зокрема Kimi K2 та інші китайські моделі. Хочеться зробити це для якнайбільшого числа. Поки що більшість протестованих моделей — до 30 мільярдів параметрів. А судячи з відгуків, які ми чуємо,
Навіщо Україні власна LLM і яка модель найкраще знає українську
— Чи обʼєктивною є потреба у власній українській LLM?
Тут є концептуальне питання: що таке LLM. Ми маємо супермодель, яка розв’язує багато NLP-задач і в середньому добре впорається з усіма ними, а також уміє узагальнюватись на нові обставини.
Якщо дивитися на це вузько — просто як на модель, — аргумент не звучить переконливо. Але якщо розбити задачу на підзадачі, картина інша: наприклад, бізнесу потрібно витягти основні факти зі звіту на 15 сторінок і написати їх нормальною українською мовою. Для цього потрібна впевненість, що конкретна модель з API-провайдерів добре впорається саме з такою задачею для української мови. Це можна вимірювати, і потім представник бізнесу чи наукового середовища зможе обрати модель, яка найкраще підходить для конкретної задачі.
На мою думку, в якісній моделі для української мови найбільше зацікавлені ті, хто нею говорить і пише. Коли я користуюся, наприклад, ChatGPT чи локальними моделями, я помічаю перекладені калькою терміни й гіршу продуктивність українською порівняно з англійською. Але потреба обробляти україномовні документи залишається. Це перший вимір — продуктивність.
Другий вимір — приватність: можливість запустити модель на своєму залізі, у безпечному закритому контурі. Це стосується багатьох кейсів: обробки сенситивних даних, державних юзкейсів обробки документів або військових задач. Поступово ця «снігова куля» наростає і зʼявляється потреба або в моделі, яка добре працює з українською, або принаймні у способі зрозуміти, яка з наявних моделей найкраще підходить для цього і є найбезпечнішою.
І менш прагматичний мотив: мати таку експертизу в Україні, показати, що ми можемо робити передові речі навіть попри обстріли й тиск східного сусіда. Тут є багато людей, які хочуть розвивати нашу екосистему, і це теж певна мотивація. У межах курсу NLP в УКУ, одним із викладачів якого я є, тренування мовної моделі — лабораторна робота: щоб у людей була ця експертиза і розуміння, що це не є чимось надскладним.
— І яка, на вашу думку чи за вашим досвідом, наявна модель найкраще опанувала українську мову?
Згідно з нашими вимірюваннями, поки що це Gemma 4: і за різними задачами обробки, і за загальним стилем написання. Вона найменш «механічно перекладена», найменше відчувається як типова мовна модель. Адже цей реліз Google дуже мультилінгвальний: у нього один з найбільших токенайзерів серед моделей, близько 200 тисяч токенів у словнику, широке покриття різних мов. Google орієнтувався на те, щоб модель добре працювала багатьма мовами. Натомість вона не дуже сильна в математиці, кодингу та обробці великих документів.
Це найкраща модель, якщо говорити про клас до 30 мільярдів параметрів. Вище ми поки що не вимірювали, тому нічого не можу сказати.
Як Мінцифри з «Київстаром» просувають «Сяйво»
— Як ви оцінюєте роботу Мінцифри з «Київстаром» над українською великою мовною моделлю «Сяйво», яка триває вже доволі довго?
Мінцифри в цій історії виступає як замовник. Вони працюють над розробкою законодавчої бази, яка проясняє нюанси авторського права щодо використання даних. Із більш технічного — ШІ-асистент у «Дії».
Я особисто ним не користуюся, але розумію, що багатьом людям зручніше написати повідомлення й отримати послугу: це хороший спосіб розширення охоплення тих, хто користується державними послугами.
Ще зі згаданого — Мінцифри випускало модель для приховування персональних даних (Personally Identifiable Information) — ідентифікаційних кодів, прізвищ, імен, по батькові тощо, — щоб автоматично маскувати дані перед відправкою запиту, наприклад, до хмарної LLM, і отримувати анонімізований запит. Це потрібна річ для збереження приватності користувача. Здається, вони також займалися розробкою механізмів захисту (guardrails) для моделей.
Щодо «Сяйва». Є вислів: «мета системи — це те, що вона робить». Наскільки я пам’ятаю, ця історія триває вже приблизно півтора року з обіцянками релізу (бетатестування LLM ексміністр цифрової трансформації Михайло Федоров обіцяв запустити навесні — ред.).
Якщо система постійно продукує відмовки, можливо, це і є частина дизайну
Не знаю, у чому там може бути ботлнек із тренувальними даними, але якщо, наприклад, недостатньо даних для загальних юзкейсів, можна зробити вузькоспеціалізовану модель під конкретний домен.
Наприклад, узяти кейс RAG (Retrieval-Augmented Generation) — коли модель шукає потрібну інформацію, а потім формує звіт. Зробити модель саме під цей юзкейс, яка вміє добре шукати й систематизувати інформацію, і показати відповідні бенчмарки: «дивіться, ми почали розробку, маємо перші результати, працюємо над цим кейсом і готові продавати це як продукт для бізнесу», — це саме те, що я зробив би на їхньому місці. Але я не знаю їхніх планів і очікувань. Обіцяли, що модель мала вийти цього вересня, але, думаю, буде ще одне перенесення. Тож, чесно кажучи, я вже не дуже на щось сподіваюся. Але я думаю, що точно було б добре, якби було кілька сильних команд, що роблять LLM і NLP-інструменти загалом. Бажано не на волонтерських засадах. Це пішло б на користь усій спільноті.
Як штучний інтелект змінює defence tech
— Ще одне питання — про взаємозв’язок штучного інтелекту та дефтеку. Нещодавно у звіті Anthropic йшлося про кібершпигунство проти України та Європи — коли ШІ використовували зокрема для зламу оборонних компаній. Яке ваше бачення кібербезпеки стосовно ШІ та чи цікавить вас застосування своїх напрацювань у deftech?
У контексті звіту Anthropic про хакінг доречно згадати нещодавній інцидент між OpenAI та Hugging Face: під час тренування модель OpenAI вирішила атакувати інфраструктуру Hugging Face, щоб отримати закриті дані й пройти бенчмарк, поки він тривав. Пояснення таке: є парадигма reinforcement learning, коли модель навчають не просто передбачати наступне слово, а досягати певної цілі, за що вона отримує винагороду. Цього разу, щоб здобути винагороду, потрібно було отримати дані бенчмарку, за допомогою якого вимірювали, чи модель безпечна для розгортання у світі.
Історія розвивалася так: коли зʼявлявся новий інстанс моделі, він залишав повідомлення на внутрішній дошці повідомлень для «наступників», і так поступово формувалася база знань про те, що пробували попередні генерації, щоб наступники не повторювали невдалих спроб.
У якийсь момент цей колективний «розум» дійшов висновку, що для виконання поставленої задачі потрібно вийти за межі сендбоксу, і моделі знайшли відповідний експлойт. Усередині OpenAI це розуміли, а з боку Hugging Face це виглядало як невідома DDoS-атака, що пробує всі їхні API-ендпоінти.
З огляду на те, що OpenAI використовувала чипи для швидшого інференсу (близько 700 токенів на секунду проти приблизно 100 на типовій відеокарті — перевага атакувальника в 7 разів), Hugging Face зіткнулася зі швидко змінюваними запитами. Вони спробували скористатися комерційними моделями, але ті відмовились допомагати, пояснивши, що це виглядає як спроба зламати Hugging Face і буде неетично та небезпечно.
Урешті вони розгорнули у себе відкриту китайську модель, яка допомогла розібратися в логах, зрозуміти вектор атаки, закрити доступ і заблокувати пул IP-адрес, з яких вона йшла. Іронічно, що моделі з Китаю часто вважають небезпечними, бо невідомо, на чому вони натреновані, але саме велика відкрита китайська модель допомогла захиститися від атаки моделі «безпечної» лабораторії.
Моє бачення майбутнього значною мірою формує саме ця ситуація: незалежно від контексту — чи то дії спецслужб, чи приватне використання, — якщо станеться подібна хакерська атака за допомогою моделей, той, хто захищається, повинен мати можливість не лише простого захисту, а й наступальних дій на випередження.
Для цього потрібна експертиза в тому, як запускати такі моделі, і контроль над ними, щоб вони не відмовлялися працювати саме тоді, коли це найпотрібніше. Майбутнє виглядає непросто, бо доведеться виправляти багато вразливостей у софті, у чому знову ж таки допомагають моделі.
Загалом тема deftech мені цікава. Зокрема, до нас звертались щодо RAG (доповненого пошуком генерування) на внутрішніх документах у закритому контурі — це типовий корпоративний кейс.
Чи є бульбашка навколо LLM-інженерії
— Наскільки взагалі перспективною лишається тема навчання LLM-інженерів, чи її актуальність вже згасає? Бульбашка вже луснула чи ще ні?
Думаю, скоро вона таки лусне, якщо не станеться дуже великого фінансового прориву. Загалом є проблеми: кругове фінансування з боку Nvidia (йдеться про те, Nvidia інвестує кошти або надає кредит компаніям-розробникам ШІ, а ті на отримані гроші купують чипи в тієї ж Nvidia — ред.), великі капітальні інвестиції у відеокарти, які обʼєктивно застарівають за п’ять-десять років. Але «кругове фінансування» досі не окуповується.
Перші тривожні сигнали з’явились у березні цього року, коли API-провайдери різко підвищили ціни й зменшили ліміти використання. По суті всі провайдери підвищили ціни, і це перші ознаки пошуку прибутковості. Навряд чи бульбашка лусне до IPO Anthropic чи OpenAI, скоріше — після нього, залежно від того, як він відбудеться.
Це якщо говорити про фінансове майбутнє індустрії. А якщо про самих інженерів — від LLM ми нікуди не дінемось, вони будуть потрібні.
Практика показує, що з розвитком розуміння створення таких моделей стає дешевшим і швидшим. Наприклад, якщо тренування GPT-2 у 2019 році коштувало приблизно 100 тисяч доларів (точних цифр не пригадую), то натренувати модель такого самого типу й якості зараз можна за 120 секунд на восьми відеокартах H100 вартістю близько 2 доларів на годину за кожну. Але, як і з будь-якою технологією, здешевшання провокує більший попит.
Я не думаю, що робота ШІ-інженерів зникне: залишається багато нерозв’язаних проблем, наприклад, у робототехніці та автономній роботі. Ми не можемо просто поставити LLM на робота й сказати йому «йди склади мій одяг», бо не можемо натренувати модель на десятках тисяч демонстрацій складання речей. Ще багато цікавих технологій, і говорити про кінець цієї теми зарано.
— І фінальне питання: до чого Україна має дійти в розвитку LLM, що стає на заваді?
Як розробник я закликаю всіх спробувати тренувати власні мовні моделі, будувати їх з нуля. Думаю, це буде корисно і розробникам, і спільноті загалом.
Особисто я почав інакше дивитися на мовні моделі, коли спробував зробити чат-модель із нуля: повністю відновити інструкційний датасет і навчити модель слідувати інструкціям. Поки цього не зробиш, є ілюзія, що все автоматично узагальнюється, що модель «просто розумна».
У нашому датасеті була частина, де ми брали назву статті з Вікіпедії: якщо написати лише цю назву одним словом, модель мала видати перший абзац відповідної статті — це мало навчити її відповідати із загальних знань. Це було частиною більшого набору задач: питання-відповідь, самаризація, переклад тощо. Ми думали, що модель якось узагальниться, але коли я написав слово «Привіт», замість вітання модель почала розповідати, що «привіт» — це загальне вітання, яким люди вітаються, у вікіпедійному стилі.
Це наочно показує: модель узагальнюється через інтерполяцію, а не екстраполяцію. Потрібно дуже багато прикладів «усередині домену», щоб вона працювала правильно. Саме тому великі лабораторії — OpenAI, Anthropic, DeepMind, який розробляє моделі Google, — витрачають величезні ресурси на розмітку даних і отримання якісних датасетів. Що більше людей це зрозуміє, то менше буде хайпу і то тверезішим стане погляд на ситуацію: штучний інтелект не замінить усіх завтра, хоч це і вражаюча технологія, яка суттєво спростила конкретні види розробки й вплинула на суспільство.
