Повноцінна тестова модель «Сяйва» має з’явитися до кінця 2026 року. На якому етапі розробка української LLM
Повноцінну тестову модель української LLM «Сяйво» планують отримати до кінця грудня 2026 року, а в січні
Що зараз відбувається з розробкою
Наразі команда збирає та перевіряє дані для навчання моделі, адаптує токенізатор для української мови й формує власну систему бенчмарків.
Для «Сяйва» збирають національний корпус даних приблизно з 90 державних установ, медіа, університетів і наукових організацій. Частину матеріалів ще потрібно оцифрувати — зокрема архівні, наукові та державні документи, які досі зберігаються на папері.
Раніше Укрдержархів передав для тренування моделі 10 ТБ даних — історичні матеріали, державні документи та наукові тексти.
Паралельно команда створює юридичний фреймворк, який має визначити правила використання таких даних і захисту інтелектуальної власності. Ферчук назвала формування українського корпусу даних та врегулювання прав на їх використання одним із головних викликів проєкту.
Розробку ведуть WINWIN AI Center of Excellence при Мінцифрі та «Київстар». Проєкт стартував у червні 2025 року. «Київстар» відповідає за організацію процесу, технічну інфраструктуру та фінансування. Державний бюджет на створення моделі не витрачають.
Як тестуватимуть «Сяйво»
Перші результати масштабного тестування очікують після завершення поточного етапу, коли команда матиме верифіковану базу даних, адаптований токенізатор і власну систему оцінювання.
Для перевірки моделі сформували експертний комітет із понад 70 фахівців. Вони працюють за чотирма напрямами:
- науково-технічним;
- етико-правовим;
- культурно-історичним;
- мовознавчим.
Серед критеріїв — точність української мови, розуміння українського культурного й історичного контексту, стійкість до галюцинацій, упереджень і дезінформації, а також відсутність дискримінаційних відповідей.
Окрім автоматичних бенчмарків, модель перевірятимуть експерти вручну та порівнюватимуть з іншими LLM у міжнародних рейтингах.
Водночас невелика версія моделі вже проходила тестування. У червні DOU писав, що «Сяйво» перейшло до етапу закритого бета-тестування. Тоді в «Київстарі» пояснювали, що йдеться про експериментальний прототип для перевірки архітектури, підходів до навчання та роботи з українською мовою. На той момент завершили pre-training та supervised fine-tuning, а модель перебувала на етапі alignment.
Модель планують відкрити для розробників
Після тестового періоду «Київстар» має передати модель державі, після чого її базову версію планують опублікувати як open source. Відкритими також мають стати українські датасети, які створюють для проєкту.
Розробники, науковці та компанії зможуть використовувати модель як основу й донавчати її для власних продуктів. Для перших інтеграцій планують створити технічний пайплайн для розробників. Для звичайних користувачів «Сяйво» має стати основою майбутніх ШІ-сервісів держави, зокрема Дія AI та AI-тьютора в «Мрії».
Такі сценарії використання закладали ще на старті проєкту. У Мінцифрі розповідали DOU, що на основі LLM хочуть створювати державні ШІ-сервіси, інструменти для роботи із законодавством та освітні продукти.
Як змінювалися строки
Строки запуску «Сяйва» вже кілька разів змінювалися. Спочатку першу версію LLM хотіли представити до кінця 2025 року.
У січні 2026 року в Мінцифрі анонсували бета-тестування на весну. У червні мала версія моделі справді перейшла до закритого тестування. Тепер у Мінцифрі очікують повноцінну тестову модель наприкінці грудня. За словами Оксани Ферчук, у січні 2027 року її сподіваються зробити публічно доступною.
Національну LLM створюють на базі Gemma 3 від Google, яку адаптують під українську мову та локальний контекст. Назву «Сяйво» українці обрали під час голосування в «Дії» у березні 2026 року.