ChatGPT будет обучаться на контенте Reddit

ChatGPT будет обучаться на контенте Reddit

ChatGPT будет обучаться на контенте Reddit

16 мая стало известно, что OpenAI заключила соглашение о партнерстве с Reddit. Оно позволит чат-боту ChatGPT получить доступ к контенту на сайте интернет-форума, который может быть использован для его обучения.

Акции компании Reddit выросли на 15% после официального объявления о заключении сделки.

Конкуренция за премиальные наборы данных среди разработчиков искусственного интеллекта обостряется.

Для OpenAI это отличная возможность получить огромное количество данных, а Reddit сможет добавить на свой сайт больше функций, основанных на ИИ, а также получать дополнительные доходы помимо рекламной выручки.

В рамках своей стратегии по повышению прибыльности Reddit недавно заключил сделку по обмену данными с Alphabet для обучения ИИ.

OpenAI также начала сотрудничество с рядом издательств, таким как Financial Times, Associated Press и другими для использования созданного СМИ контента в своих продуктах.

В то время как одни компании стремятся сотрудничать с ИИ разработчиками, другие настроены более враждебно. Недавно на OpenAl подали иск издатели газет и некоторые писатели. Они возмущены тем, что ChatGPT использует контент без их согласия.

Зарубежные нейросети тайком учили на сотнях песен Басты, Билана и Лазарева

Российские артисты незаметно отправились обучать нейросети, сотни их песен нашли в открытых зарубежных датасетах. И нет, разрешения у правообладателей, похоже, никто не спрашивал. Аналитики Национальной федерации музыкальной индустрии изучили базы Laion-Disco-12M и Sleeping-D 9M через проект AI Watchdog журнала The Atlantic.

В них хранятся миллионы композиций с YouTube, а во втором наборе — ещё и тексты с Genius, пишут «Ведомости».

Главным преподавателем для ИИ оказался Баста: в датасетах нашли 193 и 104 его трека. Следом идут Feduk — 150 и 91 композиция, Сергей Лазарев — 144 и 118, Дима Билан — 140 и 119, а также группа «Звери» — 135 и 41. В списке засветились Леонид Агутин, Егор Крид, Ваня Дмитриенко и другие исполнители. Туда же попали десятки видеороликов с участием российских артистов.

Само наличие песни в базе ещё не доказывает, что конкретная нейросеть действительно на ней училась. Но вероятность такого сценария The Atlantic оценивает как высокую.

Представители музыкальной индустрии утверждают, что ни зарубежные, ни российские разработчики ИИ за лицензиями к ним не обращались. Рассуждения, видимо, были такие: если контент лежит в открытом интернете, значит, его будто бы можно молча забрать в учебник для алгоритма. Иногда источником могут становиться и пиратские площадки.

Тем временем легальные сделки на мировом рынке уже появляются: Warner Music договорилась с Suno, а Universal Music Group — с Udio. Но пока это редкие исключения.

По оценке НИУ ВШЭ, совокупные потери авторов и правообладателей из-за генеративного контента за 2025-2030 годы могут достигнуть 1 трлн рублей. Российская музыкальная индустрия теперь требует прозрачного лицензирования.

RSS: Новости на портале Anti-Malware.ru