Автор: Кэти Пол
НЬЮ-ЙОРК (Рейтер) - Материнская компания Facebook Meta Platforms во вторник выпустила модель искусственного интеллекта, способную переводить и транскрибировать речь на десятках языков, что является потенциальным строительным блоком для инструментов, позволяющих общаться в режиме реального времени, несмотря на языковые различия.
Компания сообщила в своем блоге, что ее модель SeamlessM4T может поддерживать переводы между текстом и речью почти на 100 языках, а также полный перевод речи в речь для 35 языков, сочетая технологию, которая ранее была доступна только в отдельных моделях.
Генеральный директор Марк Цукерберг заявил, что он представляет себе такие инструменты, облегчающие взаимодействие между пользователями со всего мира в метавселенной, наборе взаимосвязанных виртуальных миров, на которые он делает ставку в будущем компании.
Meta делает модель доступной для общественности для некоммерческого использования, говорится в сообщении в блоге.
Крупнейшая в мире компания, занимающаяся социальными сетями, выпустила в этом году множество в основном бесплатных моделей искусственного интеллекта, в том числе большую языковую модель под названием Llama, которая представляет серьезную проблему для проприетарных моделей, продаваемых OpenAI при поддержке Microsoft и Google от Alphabet.
Цукерберг говорит, что открытая экосистема искусственного интеллекта работает на пользу Meta, поскольку компания может больше выиграть от эффективного краудсорсинга при создании ориентированных на потребителя инструментов для своих социальных платформ, чем от взимания платы за доступ к моделям.
Тем не менее, Meta сталкивается с теми же юридическими вопросами, что и остальная отрасль, в отношении обучающих данных, используемых для создания ее моделей.
В июле комик Сара Сильверман и два других автора подали иски о нарушении авторских прав как против Meta, так и против OpenAI, обвинив компании в использовании их книг в качестве обучающих данных без разрешения.
Что касается модели SeamlessM4T, исследователи Meta сообщили в исследовательской статье, что они собрали данные для обучения аудиозаписи из 4 миллионов часов "необработанного аудио, полученного из общедоступного хранилища веб-данных для обхода", не уточнив, из какого хранилища.
Представитель Meta не ответил на вопросы о происхождении аудиоданных.
Текстовые данные были получены из наборов данных, созданных в прошлом году, которые извлекли контент из Википедии и связанных с ней веб-сайтов, говорится в исследовательском документе.
(Репортаж Кэти Пол, редактирование Розальбой О'Брайен)
