Українська LLM «Сяйво» на етапі бета-тестування: що вміє національна ШІ-модель

Українська LLM «Сяйво» вже проходить закрите бета-тестування і має стати основою для державних ШІ-сервісів.

Національна ШІ-модель «Сяйво». Фото - Kreschatic.

Як повідомляє DOU⁠ з посиланням на команду «Київстару», національна велика мовна модель «Сяйво», яку спільно розробляють Міністерство цифрової трансформації та «Київстар», перейшла до закритого бета-тестування. Зараз це ще не повноцінна LLM, а зменшений прототип, на якому перевіряють архітектуру, якість відповідей і роботу з українською мовою.

Модель має стати основою для майбутніх державних і комерційних ШІ-сервісів. Серед перших напрямів інтеграції називають ШІ-асистента в «Дії» та освітнього тьютора у «Мрії», пише Kreschatic⁠.

На якому етапі перебуває «Сяйво»

Наразі «Сяйво» проходить закрите тестування у форматі експериментальної версії. Її використовують для перевірки технічних рішень, поведінки моделі та здатності коректно працювати з українським мовним і культурним контекстом.

Базові етапи навчального процесу вже завершені. Команда пройшла передтренування та supervised fine-tuning, після чого модель перейшла до етапу alignment. На цій стадії розробники вирівнюють її поведінку відповідно до вимог якості, безпеки, стабільності та точності відповідей.

До тестування залучили чотири наукові комітети: лінгвістичний, історичний, технічний та етико-правовий. Їхнє завдання полягає в тому, щоб оцінити відповіді моделі, знайти слабкі місця та підготувати рекомендації для подальшого вдосконалення.

Чому проєкт важливий для України

У Мінцифри розглядають «Сяйво» не лише як окрему модель, а як частину ширшої державної ШІ-інфраструктури. Йдеться про створення власних обчислювальних потужностей, які дозволять тренувати моделі та зберігати критичні дані всередині країни.

Такий підхід має зменшити залежність від іноземних хмарних сервісів і дати Україні більше контролю над розвитком штучного інтелекту. Для державних сервісів це особливо важливо, адже частина даних може бути чутливою або стратегічною.

Окреме значення має українська мова. Більшість сучасних великих мовних моделей навчаються переважно на англомовному контенті, тому вони не завжди добре розуміють українські реалії, історичні контексти, правові формулювання та локальні мовні особливості.

На чому навчають українську модель

Технологічною основою для «Сяйва» стала відкрита модель Gemma 3 від Google. Вона підтримує понад 35 мов, зокрема українську, а також має мультимодальні можливості. На цій базі розробники створюють модель, адаптовану саме до українського контексту.

Для навчання зібрали матеріали від понад 50 медіа, університетів і бібліотек. Також до проєкту долучився Укрдержархів, який передав 10 терабайтів документів різних епох. Йдеться про друковані, рукописні, наукові та архівні матеріали.

Саме такі дані мають допомогти моделі краще працювати з українською мовою, історичними джерелами, державними документами та освітніми сценаріями. Це важливо не лише для якості відповідей, а й для зменшення помилок у темах, де потрібне точне розуміння контексту.

Де можуть використовувати «Сяйво»

Кінцева мета проєкту — створити модель, яка стане базою для різних ШІ-продуктів в Україні. Насамперед її планують застосовувати у державних сервісах, де потрібні україномовні асистенти, автоматична обробка звернень, допомога користувачам і робота з великими масивами інформації.

Одним із перших прикладів може стати асистент у «Дії». Такий інструмент потенційно зможе допомагати громадянам орієнтуватися в послугах, документах і процедурах. Інший напрям — освітній тьютор у «Мрії», який має підтримувати навчальні сценарії та персоналізовану допомогу для учнів.

Для бізнесу така модель також може стати основою для комерційних продуктів, якщо її можливості відкриють для ширшого використання. Насамперед ідеться про сервіси, яким потрібна якісна робота українською мовою та розуміння місцевого контексту.

Коли чекати повноцінну версію

Точної дати запуску повноцінної версії «Сяйва» поки не називають. Нинішній етап закритого бета-тестування потрібен для перевірки прототипу, доопрацювання поведінки моделі та підготовки до подальшого масштабування.

Загальний обсяг інвестицій у проєкт, за наявними даними, має перевищити 18 мільйонів євро. Назву «Сяйво» модель отримала після відкритого голосування в «Дії» наприкінці березня. За цей варіант проголосували понад 22 тисячі користувачів із 136 тисяч учасників.

Після завершення тестування модель можуть поступово інтегрувати у державні цифрові сервіси. Якщо проєкт реалізують у заявленому форматі, Україна отримає власну мовну модель, адаптовану до потреб держави, бізнесу та україномовних користувачів.

Нагадаємо, раніше ми писали про налаштування рекомендацій YouTube, TikTok та Instagram під власні інтереси.

Поділіться цією статтею