Нейросеть для ЖКХ научилась материться в первый месяц обучения

Нейросеть для ЖКХ научилась материться в первый месяц обучения

Нейросеть для ЖКХ научилась материться в первый месяц обучения

Разработчикам отечественного голосового помощника для сферы ЖКХ пришлось «переучивать» систему после того, как в процессе обучения бот освоил ненормативную лексику. Этот случай наглядно показал, насколько критично качество данных, на которых обучаются нейросети.

О возникшей проблеме рассказал ТАСС президент Национального объединения организаций в сфере технологий информационного моделирования (НОТИМ) Михаил Викторов на Сибирском строительном форуме, который проходит в Новосибирске.

«Приведу забавный случай: нейросеть учится, и буквально уже в первый месяц разработчики обнаружили такую коллизию — нейросеть научилась мату. Как говорится, с кем поведёшься, от того и наберёшься. Эту проблему, конечно, пришлось устранять. Но это в том числе показатель активного взаимодействия с нашими гражданами», — рассказал Михаил Викторов.

При этом, по его словам, внедрение ботов позволило сократить число операторов кол-центров в 5–6 раз без потери качества обслуживания. Нейросетевые инструменты способны обрабатывать до 90% входящих обращений.

Уровень удовлетворённости качеством обслуживания, по оценке Викторова, составляет около 80%. Передавать звонки операторам целесообразно лишь в экстренных случаях — например, при аварийных ситуациях.

Эксперты ранее отмечали, что именно данные, на которых обучается ИИ, являются ключевой причиной появления некорректных или предвзятых ответов нейросетевых инструментов.

Зарубежные нейросети тайком учили на сотнях песен Басты, Билана и Лазарева

Российские артисты незаметно отправились обучать нейросети, сотни их песен нашли в открытых зарубежных датасетах. И нет, разрешения у правообладателей, похоже, никто не спрашивал. Аналитики Национальной федерации музыкальной индустрии изучили базы Laion-Disco-12M и Sleeping-D 9M через проект AI Watchdog журнала The Atlantic.

В них хранятся миллионы композиций с YouTube, а во втором наборе — ещё и тексты с Genius, пишут «Ведомости».

Главным преподавателем для ИИ оказался Баста: в датасетах нашли 193 и 104 его трека. Следом идут Feduk — 150 и 91 композиция, Сергей Лазарев — 144 и 118, Дима Билан — 140 и 119, а также группа «Звери» — 135 и 41. В списке засветились Леонид Агутин, Егор Крид, Ваня Дмитриенко и другие исполнители. Туда же попали десятки видеороликов с участием российских артистов.

Само наличие песни в базе ещё не доказывает, что конкретная нейросеть действительно на ней училась. Но вероятность такого сценария The Atlantic оценивает как высокую.

Представители музыкальной индустрии утверждают, что ни зарубежные, ни российские разработчики ИИ за лицензиями к ним не обращались. Рассуждения, видимо, были такие: если контент лежит в открытом интернете, значит, его будто бы можно молча забрать в учебник для алгоритма. Иногда источником могут становиться и пиратские площадки.

Тем временем легальные сделки на мировом рынке уже появляются: Warner Music договорилась с Suno, а Universal Music Group — с Udio. Но пока это редкие исключения.

По оценке НИУ ВШЭ, совокупные потери авторов и правообладателей из-за генеративного контента за 2025-2030 годы могут достигнуть 1 трлн рублей. Российская музыкальная индустрия теперь требует прозрачного лицензирования.

RSS: Новости на портале Anti-Malware.ru