Последствия взлома Gawker Media: рейтинг пользовательских паролей

Последствия взлома Gawker Media: рейтинг пользовательских паролей

...

Американский поставщик средств и систем двухфакторной аутентификации Duo Security решил изучить снимок базы данных Gawker Media, который выложили в открытый доступ взломщики из группировки Gnosis (о самом инциденте Anti-Malware.ru уже писал ранее). Анализ БД позволил, в частности, составить рейтинг пользовательских паролей, а также получить некоторые другие небезынтересные сведения.



Итак, в блоге Duo Security аналитик Джон Оберхейд рассказал о том, что же ему удалось извлечь из дампа базы. В первую очередь специалист провел исследование паролей к учетным записям, задействовав для этого специализированное программное обеспечение, которое позволяет восстанавливать пароли из хэшей. Поскольку алгоритм хэширования был примитивен (как, впрочем, и сами пароли), то уже через час работы инструмента с предзагруженным словарем были вскрыты почти 200 тыс. кодовых слов. В конечном счете г-ну Оберхейду удалось раскрыть и обработать почти 400 тыс. паролей.


Аналитик составил следующий рейтинг из 25 наиболее популярных паролей:









Пароль Количество пользователей

123456


password


12345678


qwerty


abc123


12345


monkey


111111


consumer


letmein


1234


dragon


trustno1


baseball


gizmodo


whatever


superman


1234567


sunshine


iloveyou


fuckyou


starwars


shadow


princess


cheese


2516


2188


1205 


696


498


459


441


413


385


376


351


318


307

303

302


300


297


276


266


266


262


256


255


241


234


Подавляющее большинство паролей (99,45%) содержали только буквы и / или цифры, т.е. в них не было никаких специальных символов. 61% кодовых слов состоял только из букв в нижнем регистре, а при создании 9% паролей были задействованы исключительно цифры.


Помимо этого, специалист провел анализ почтовых доменов, который позволил обнаружить, что среди зарегистрированных пользователей сайтов Gawker Media были сотрудники государственных учреждений Соединенных Штатов Америки. В частности, в базе есть 15 адресов NASA (@nasa.gov), 9 адресов Палаты представителей (@mail.house.gov), 6 адресов администрации социального страхования (@ssa.gov) и даже 2 адреса Белого дома (@whitehouse.gov). Среди обычных доменов, кстати, абсолютным лидером оказался @gmail.com - 173 942 пользователя.


Из всего изложенного выше нетрудно сделать вывод, что участники тех или иных ресурсов не расстаются с привычкой устанавливать откровенно слабые пароли на свои учетные записи. За всю историю подобных исследований верхние позиции рейтингов так и не подвергались критическим изменениям: за первое место с переменным успехом борются кодовые слова "12345", "password" и "qwerty" (а также их незначительные вариации наподобие "123456" или "password1"). Тревожным звонком можно считать обнаружение в базе правительственных адресов: не секрет, что многие пользователи склонны использовать один и тот же пароль для всех сервисов, где требуется авторизация, а это создает риски новых взломов и компрометаций.


Подробная информация (на английском языке) доступна в первоисточнике.

писал ранее). Анализ БД позволил, в частности, составить рейтинг пользовательских паролей, а также получить некоторые другие небезынтересные сведения.

" />

Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Российскому ИИ не хватает данных, а закон, по мнению бигтеха, держит их под замком. Ассоциация больших данных, в которую входят «Авито», «Сбер», «Ростелеком», «Яндекс», HH и VK, попросила Минцифры упростить использование обезличенной персональной информации для разработки и обучения нейросетей.

Сейчас любое алгоритмическое преобразование персональных данных считается обезличиванием.

Даже если технология практически исключает возможность установить личность человека, полученный массив всё равно остаётся персональными данными со всеми сопутствующими ограничениями. Защита вроде бы сработала, а юридический хвост никуда не делся.

АБД, по данным КоммерсантЪ, предлагает выделить технологии повышения приватности — Privacy Enhancing Technologies, или PETs — в отдельную категорию. Они позволяют обрабатывать, передавать и хранить информацию без раскрытия личности. Если риск идентификации равен нулю или составляет малые доли процента, такие данные предлагается использовать для ИИ без согласия граждан.

Обработка при этом должна проходить в России, российскими компаниями и только для разработки, обучения и применения ИИ. Кроме того, ассоциация предлагает ввести доверенных посредников — аккредитованные организации, которые будут хранить обезличенные массивы и предоставлять к ним доступ. Данные также хотят разделить на бесплатные, необходимые для исполнения закона, и платные — для коммерческих задач.

Участники рынка объясняют инициативу просто: российских датасетов мало, а большая их часть заперта внутри крупных экосистем. Собственные и партнёрские массивы уже не закрывают аппетиты современных моделей, особенно специализированных корпоративных решений.

Альтернативой остаются синтетические данные — искусственно созданные наборы без сведений о реальных людях. Но полностью заменить ими отраслевую статистику, поведенческие закономерности и другие ценные выборки получится не всегда.

Теперь мяч у Минцифры, которое на обращение пока не ответило. Бигтех тем временем даёт понять: без свежих данных российский ИИ далеко не уедет, сколько вычислительных мощностей ему ни подбрасывай.

RSS: Новости на портале Anti-Malware.ru