Google Messages использует маячки из чатов для тренировки ИИ-антиспама

Google Messages использует маячки из чатов для тренировки ИИ-антиспама

Google Messages использует маячки из чатов для тренировки ИИ-антиспама

Google доработала защитную функциональность приложения Messages, «родного» мессенджера в мобильной операционной системе Android. Теперь функция обнаружения спама будет опираться в том числе на ИИ, обучающийся на маячках из незашифрованных чатов.

Задача фичи — отсеивать нежелательные или откровенно вредоносные СМС-сообщения. Опция обнаружения спама по умолчанию включена в Google Messages.

В идеале все потенциально опасные сообщения должны складываться в специальную директорию — «Спам», при этом все личные переписки пользователя, по словам разработчиков, не сканируются.

«С активированной функцией обнаружения спама ваши переписки остаются приватными», — гласит официальная документация.

Кроме того, Google добавила в спам-детектор алгоритмы машинного обучения, которые будут выискивать в сообщениях определённые паттерны, потенциально указывающие на спам.

Например, будет проверяться наличие ссылок во входящих СМС-сообщениях. Если таковые имеются, система направит их Google, чтобы убедиться в безвредности. При этом куски подозрительного текста будут расцениваться как «маячки», на которых и обучается ИИ-модель.

В Google подчёркивают, что антиспам будет анализировать текст исключительно в незашифрованных переписках, чтобы ваши личные коммуникации остались нетронутыми.

Зарубежные нейросети тайком учили на сотнях песен Басты, Билана и Лазарева

Российские артисты незаметно отправились обучать нейросети, сотни их песен нашли в открытых зарубежных датасетах. И нет, разрешения у правообладателей, похоже, никто не спрашивал. Аналитики Национальной федерации музыкальной индустрии изучили базы Laion-Disco-12M и Sleeping-D 9M через проект AI Watchdog журнала The Atlantic.

В них хранятся миллионы композиций с YouTube, а во втором наборе — ещё и тексты с Genius, пишут «Ведомости».

Главным преподавателем для ИИ оказался Баста: в датасетах нашли 193 и 104 его трека. Следом идут Feduk — 150 и 91 композиция, Сергей Лазарев — 144 и 118, Дима Билан — 140 и 119, а также группа «Звери» — 135 и 41. В списке засветились Леонид Агутин, Егор Крид, Ваня Дмитриенко и другие исполнители. Туда же попали десятки видеороликов с участием российских артистов.

Само наличие песни в базе ещё не доказывает, что конкретная нейросеть действительно на ней училась. Но вероятность такого сценария The Atlantic оценивает как высокую.

Представители музыкальной индустрии утверждают, что ни зарубежные, ни российские разработчики ИИ за лицензиями к ним не обращались. Рассуждения, видимо, были такие: если контент лежит в открытом интернете, значит, его будто бы можно молча забрать в учебник для алгоритма. Иногда источником могут становиться и пиратские площадки.

Тем временем легальные сделки на мировом рынке уже появляются: Warner Music договорилась с Suno, а Universal Music Group — с Udio. Но пока это редкие исключения.

По оценке НИУ ВШЭ, совокупные потери авторов и правообладателей из-за генеративного контента за 2025-2030 годы могут достигнуть 1 трлн рублей. Российская музыкальная индустрия теперь требует прозрачного лицензирования.

RSS: Новости на портале Anti-Malware.ru