Языковые модели тупеют от мусорных данных из интернета

Языковые модели тупеют от мусорных данных из интернета

Языковые модели тупеют от мусорных данных из интернета

Группа исследователей из Университета Техаса и Университета Пердью предложила необычную идею: большие языковые модели (LLM), вроде ChatGPT, могут «тупить» от некачественных данных примерно так же, как люди — от бесконечных часов в соцсетях.

В отчёте специалисты выдвигают «гипотезу гниения мозга LLM». Суть проста: если продолжать дообучать языковую модель на «мусорных» текстах из интернета, она со временем начнёт деградировать — хуже запоминать, терять логику и способность к рассуждению.

Авторы понимают, что отличить хороший контент от плохого сложно. Поэтому они решили изучить 100 миллионов твитов с HuggingFace и отобрать те, что подходят под определение «junk».

В первую группу попали короткие твиты с большим количеством лайков и репостов — те самые, которые вызывают максимальное вовлечение, но несут минимум смысла. Во вторую — посты с «низкой семантической ценностью»: поверхностные темы, кликбейт, громкие заявления, конспирология и прочие «триггерные» темы.

 

Чтобы проверить качество отбора, результаты GPT-4o сверили с оценками трёх аспирантов — совпадение составило 76%.

Учёные обучили четыре разные языковые модели, комбинируя «мусорные» и «качественные» данные в разных пропорциях. Потом прогнали их через тесты:

  • ARC — на логическое рассуждение,
  • RULER — на память и работу с длинным контекстом,
  • HH-RLHF и AdvBench — на этические нормы,
  • TRAIT — на анализ «личностного стиля».

Результаты оказались любопытными: чем больше в обучающем наборе было «интернет-мусора», тем хуже модель справлялась с задачами на рассуждение и память. Однако влияние на «этичность» и «черты личности» было неоднозначным: например, модель Llama-8B с 50% «мусора» даже показала лучшие результаты по «открытости» и «низкой тревожности».

Исследователи сделали вывод: переизбыток интернет-контента может привести к деградации моделей и призвали разработчиков тщательнее отбирать данные для обучения. Особенно сейчас, когда всё больше онлайн-текста создаётся уже самими ИИ — и это может ускорить эффект так называемого model collapse, когда модели начинают обучаться на собственных ошибках.

Учёные шутят: если так пойдёт и дальше, возможно, придётся вернуться к книгам — хотя бы ради того, чтобы «накормить» модели чем-то действительно качественным.

Taobao получила первый в России штраф за утечку среди иностранных компаний

Известные штрафы за утечки персональных данных в России достигли 2,195 млн рублей в первом полугодии 2026 года, подсчитала InfoWatch. Это втрое больше, чем за аналогичный период 2025-го, и примерно в полтора раза больше совокупной суммы за весь прошлый год.

За шесть месяцев российские суды вынесли 13 штрафов. Годом ранее за тот же период их было 15, однако денежные санкции оказались значительно скромнее — 725 тыс. рублей.

Аналитики ожидают дальнейшего роста сумм: новые штрафы действуют с мая 2025 года, а оборотные санкции за повторные утечки пока вообще не применялись.

Главным событием стало первое подобное наказание иностранной компании. Платформу Taobao, принадлежащую Alibaba Group, оштрафовали на 1 млн рублей после киберинцидента, при котором злоумышленники получили административные права на инфраструктуру и доступ к данным сотрудников и примерно 100 соискателей. Компания обжаловала решение.

В InfoWatch называют дело прецедентным: раньше иностранные сервисы наказывали главным образом за отказ локализовать данные россиян, теперь регулятор добрался и до самих утечек.

На мировом фоне российские суммы пока выглядят как мелочь из кармана. Крупнейший штраф первого полугодия получил корейский маркетплейс Coupang — около $409 млн за утечку данных примерно 33 млн пользователей. Но в целом можно отметить, что ценник за дырявую защиту уже пополз вверх.

RSS: Новости на портале Anti-Malware.ru