В Марий Эл начали готовить «чистые» данные для нейросетей

В МарГУ заявили об искажении образов марийской культуры в западных нейросетях и создают «чистый» датасет
Вера Ивановна Токтарова
Вера Токтарова (Фото: Пресс-служба Марийского государственного университета)

Марийский государственный университет совместно с компанией «Яндекс» реализует проект по созданию научно верифицированной базы данных изображений национального костюма и предметов быта марийского народа. Это позволит исключить искажение культурных особенностей финно-угорских народов, возникающее при использовании западных датасетов для обучения нейросетей. Об этом сообщила проректор по стратегическому развитию МарГУ Вера Токтарова на конференции «Цифровизация языков народов России: масштабирование опыта и перспективы».

Каждое изображение в создаваемом датасете получает разметку на марийском и русском языках. К работе привлекаются этнографы, лингвисты и культурологи, что гарантирует научную достоверность материалов и отсутствие стереотипов, отметила она. Полученный массив данных будет использоваться в задачах машинного обучения и генерации изображений.

«Западные датасеты часто содержат искаженные представления о культуре малых народов. Наш проект позволяет сформировать «чистый» эталон визуального образа — от орнамента до покроя костюма, — отметила Токтарова. — Это часть работы по обеспечению цифрового суверенитета малых этносов».

В дальнейшем университет планирует цифровизовать музыку этнической направленности и улучшить технологии автоматического перевода мультфильмов, продолжив сотрудничество с ведущими технологическими компаниями.

Проект опирается на уже достигнутые МарГУ результаты в области цифровизации языков. Как ранее сообщал «Кидшер», марийский язык занимает четвертое место среди языков народов России по популярности в сервисе «Яндекс Переводчик».

Создан аудиокорпус объемом более 500 часов — собраны живые образцы речи носителей старшего поколения. На этой базе университетом совместно с партнерами разработаны технологии распознавания речи, электронные словари, системы проверки правописания и синтеза речи. Кроме того, ученые университета применяют искусственный интеллект для оживления старых фотографий и создания виртуальных помощников-наследников языка.

Кидшер
Расскажите, что вы думаете по поводу этого текста