Укрдержархів вперше передасть 10 ТБ даних для тренування національної LLM «Сяйво»

Державна архівна служба України вперше передасть свої дані для тренування національної мовної моделі «Сяйво».

Йдеться про 10 терабайтів унікальних історичних матеріалів, державних документів і наукових текстів. Про це повідомили в Мінцифри.

Такий масив даних дорівнює 70 000 книжок. У міністерстві пояснили, що тренування LLM на україномовних джерелах дозволить моделі краще розуміти український контекст. На сьогодні більшість великих ШІ-помічників працюють переважно на англомовних даних, а українською часто просто перекладають відповіді.

Голова Укрдержархіву Анатолій Хромов заявив, що передані дані містять великий масив матеріалів різних історичних епох — друкованих і рукописних, українською та іншими мовами. За його словами, до кінця 2026 року кількість цифрових копій у держархівах має зрости зі 150 млн до понад 200 млн.

У Мінцифри кажуть, що створення великої мовної моделі є частиною ширшого проєкту з побудови ШІ-суверенітету. Зараз для цього збирають якісний масив даних. За даними відомства, свої матеріали вже надали понад 50 медіа, університетів та бібліотек.

Похожие статьи:
Встречайте свежий SQL Server дайджест. В этом выпуске: SQL Server 2016 CTP 3.0/3.1, Новогодняя встреча Ukrainian Data Community Kyiv, R в SQL Server и многое другое. SQL Server...
У свіжому дайджесті DOU News поговоримо про дозвіл на бронювання виробників дронів, найбільші угоди тижня, величезну атаку на ваші...
В ніч на 23 червня росіяни атакували Київ і область дронами та балістикою. Внаслідок атаки загинули 6 людей, ще 13 — поранені....
30 квітня у Вашингтоні Україна та Сполучені Штати підписали угоду про створення Інвестиційного фонду відбудови. Його мета —...
Grammarly приглашает в гости всех, интересующихся продуктовой разработкой. Поговорим о прелестях работы Product Owner’а, об общих...

Яндекс.Метрика