Более 12 миллионов секретов стали общедоступны на GitHub и Python PyPI

Более 12 миллионов секретов стали общедоступны на GitHub и Python PyPI

Более 12 миллионов секретов стали общедоступны на GitHub и Python PyPI

Эксперты GitGuardian в своём отчете за 2023 год обнародовали информацию более чем о 10 миллионах раскрытых секретов и ключей аутентификации в публичных коммитах GitHub.

К ним относятся пароли, ключи API и другие учетные данные. Поразительно, но к 2024 году стало известно о новых прецедентах – более 12,8 млн раскрытых секретов в GitHub, а так же о некотором числе утечек в популярном репозитории Python PyPI, которые содержат более 20 терабайт файлов в свободном доступе.

По словам GitGuardian, за 2023 год ключи API OpenAI, ключи API Google и ключи Google Cloud стали самыми распространенными обнародованными секретами. К сожалению, это влечет за собой возможность несанкционированного доступа угрозу утечки данных. Ведь любому грамотному специалисту будет по силам найти один общий формат секрета, написав регулярное выражение и использовав автоматизацию проверок на валидность. Тем самым он добывает конфиденциальную информацию.

К сожалению, доверие к публичным репозиториям падает. Ключи, опубликованные в GitHub или PyPI, считаются изначально скомпрометированными. Исследователи провели ряд тестов, где honeytoken (своего рода "разряженный" API-ключ, не имеющий доступа ни к каким ресурсам) проверялся на валидность ботами в течение минуты после публикации на GitHub.

Honeytokens остаются недооцененными, ведь они выступают в роли "доносчика" для все большего числа разработчиков. Они помогают увидеть, что кто-то шпионил там, где вы их разместили, и получить некоторую информацию на основе данных телеметрии, собранных при использовании honeytoken.

Больше всего беспокойства вызывает не только факт, что при публикации секрета злоумышленник может добраться до cloud bill, но и возможность утечки более серьёзной информации при избыточных полномочиях секрета.

Если вдруг вы обнаружили утечку секрета в публичной коллекции исходного кода, то для начала — отзовите его. Помните, что как только ваш секрет опубликован, то он с большой вероятностью уже скопирован. Несмотря на то, что исходный код находится в закрытом хранилище, злоумышленники способны получить доступ к ним при помощи социальной инженерии, фишинга и утечки секретов.

Нужно понимать, что секреты в исходном коде рано или поздно обнаруживаются как в частном хранилище, так и в публичном реестре. Чтобы хоть каким-то способом обезопасить себя, придерживайтесь следующих правил:

  • не храните секреты открытым текстом в исходном коде;
  • ограничивайте привилегии, которые эти секреты предоставляют;
  • если вы обнаружили утечку секрета, отмените его;
  • внедрите автоматизацию, подобную той, что предлагает GitGuardian.

Следуя данным правилам, вам, возможно, не придется сталкиваться с утечкой секретов.

Напомним, в конце прошлого месяца популярный репозиторий Python Package Index (PyPI) ограничил возможность регистрации новых пользователей после масштабной вредоносной кампании по распространению трояна, похищающего данные.

А в январе GitHub провел ротацию ключей после возможной компрометации учетных данных.

Российские математики научили ИИ-модели общаться без слов

Российский стартап Mostik разработал способ объединять возможности разных ИИ-моделей без обмена текстовыми ответами. Вместо длинной переписки нейросети взаимодействуют через математические значения во внутренних представлениях.

Обычно ансамбль работает последовательно: одна модель генерирует ответ, а другая получает его на вход.

Это требует времени и вычислительных ресурсов. Метод Mostik позволяет передавать информацию между моделями на более глубоком уровне, помогая небольшой нейросети использовать возможности значительно более крупной.

Для демонстрации команда связала китайскую GLM-5.2 с 753 млрд параметров и компактную Qwen-3.5 на 4 млрд параметров, способную работать на мобильном устройстве.

По утверждению разработчиков, получившаяся система показала результат ровно посередине между исходными моделями, но обошлась в 20 раз дешевле запуска полной GLM.

Ещё одну систему Mostik вывел в лидеры сложного соревнования ARC-AGI 3, предназначенного для проверки способности ИИ решать новые задачи. Подробности команда пока скрывает, чтобы не раскрывать подход до завершения конкурса.

Гендиректор стартапа Саша Малышева считает, что будущее ИИ может принадлежать не одной гигантской модели, а коллективу специализированных нейросетей. Внутри компании этот подход сравнивают с угадыванием веса свиньи: усреднённая оценка группы людей иногда оказывается точнее ответа одного эксперта.

Если технология подтвердит эффективность на разных моделях и задачах, она может повысить ценность открытых нейросетей. Крупную модель получится объединить с небольшими экспертами по медицине, физике или биологии, не заставляя вычислительного монстра выполнять всю работу.

Пока опубликованных технических деталей и независимого воспроизведения результатов нет. Подробнее про проект пишет издание WIRED.

RSS: Новости на портале Anti-Malware.ru