Тема

Чернышенко в Иннополисе: советское научное наследие оцифруют для обучения суверенных ИИ-моделей

Чернышенко в Иннополисе: советское научное наследие оцифруют для обучения суверенных ИИ-моделей

Россия оцифрует советское научное наследие, чтобы обучать на нем отечественные ИИ-модели. Об этом сегодня на пленарной сессии «Цифровых дней Иннополиса» заявил вице-премьер РФ Дмитрий Чернышенко.

Дмитрий Чернышенко
Дмитрий Чернышенко
Фото: «БИЗНЕС Online»

«Мы переводим в цифру, вы слышали, фонды государственной системы научно-технической информации. У нас задача оцифровать все наше советское наследие <…> Все это наследие создаст суперпозицию для наших обученных суверенных моделей», — сказал он.

Данные Чернышенко назвал первым из трех условий развития ИИ в науке наряду с вычислительными мощностями и доступом ученых к ним.

В государственной базе сейчас около 1,5 млн статей и других научных материалов. Кроме того, ожидается поступление около 600 млн научных данных на микрофильмах, карточках и других материалах. Это наследие вице-премьер предложил беречь в том числе от дистилляции и от неправомерного использования. Под дистилляцией понимают обучение одной модели на ответах другой.

Чернышенко активно продвигает инициативу по созданию отечественных дата-сетов с учетом российской и советской специфики. Ранее он объяснял, что подобные массивы данных необходимы для обучения нейросетей с целью корректного распознавания сложных исторических контекстов и архивных материалов.

Источник: БИЗНЕС Online