Яндекс опроверг прослушку Алисой

Яндекс опроверг прослушку Алисой

Яндекс опроверг прослушку Алисой

Яндекс” никогда не прослушивал пользователей “умных” устройств, заявили в ИТ-корпорации. Оправдываться пришлось после того, как в Сеть попал торрент с исходным кодом сервисов Яндекса. В компании подчеркивают: алгоритм, когда микрофон включается без упоминания “Алисы”, работает только в бета-версии.

Хронология громкой истории с “открывшимся” кодом Яндекса выглядит так:

25 января бывший сотрудник “Яндекса” выкладывает в Сеть 45 ГБ внутреннего репозитория корпорации. Раздача содержит отдельные архивы (.tar.bz2), по названиям которых можно определить сервисы: “Яндекс Карты”, поиск, “Яндекс Такси”, “Яндекс Почту”, голосового помощника “Алису”, “Яндекс Маркет”, “Яндекс Go” и платежный сервис Yandex Pay.

26 января “Яндекс” подтверждает факт утечки, заверив, что “слив” не содержит персональных данных пользователей, а его содержимое — устаревшая версия репозитория.

30 января “Яндекс” публикует внутреннее расследование инцидента и приносит извинение за нарушение ИБ-политик и техноэтики.

Оказалось, что слитый архив содержит данные водителей “Яндекс Такси”, ошибки в системе часто исправляли в ручном режиме, а не алгоритмами, а сами айтишники позволяли себе оскорбительные и расистские комментарии во внутренней переписке.

Среди прочего выделялся тревожный пункт с “умной” колонкой “Алиса”. В бета-версии устройство включалось в случайный момент времени без уведомления о своем присутствии.

“Важно отметить, что опубликованные фрагменты кода содержат в том числе и тестовые алгоритмы, которые использовались только внутри Яндекса для проверки корректности работы сервисов. Например, для улучшения качества активации ассистента и уменьшения количества ложных срабатываний в бета-версии для сотрудников применяется настройка, которая включает микрофон устройства на несколько секунд в случайный момент без упоминания Алисы”, — цитата сообщения Яндекса.

В прессе стали писать, что в этом контексте “Алиса” могла включаться и в финальной версии устройства, поступающего в продажу. Такое предположение сделал накануне и Anti-Malware.ru.

Яндексу снова пришлось выступать с комментариями.

“Наш приоритет — удобство пользователей, поэтому мы используем “бету” для проверки продуктовых гипотез”, — заявил представитель Яндекса изданию РБК.

По его словам, алгоритм “молчаливого включения” Алисы работает только в “бете”, и “результатом его работы является уменьшение количества ложных срабатываний ассистента для всех пользователей”.

Добавим, западные эксперты, в свою очередь, обратили внимание на то, что SEO-алгоритмы в исходном коде Яндекса схожи с факторами ранжирования в поисковике Google. А по словам одного из специалистов, “слив кода Яндекса — вероятно, самое интересное, что произошло в SEO за долгие годы”.

Пресс-служба Яндекс направила в редакцию Anti-Malware.ru расширенный комментарий:

«Яндекс никогда не прослушивал пользователей “умных устройств". Как мы писали ранее в пресс-релизе, опубликованные фрагменты кода применяются только в бета-версии голосового помощника для записи нескольких секунд звука в случайный момент. В бете могут участвовать только сотрудники Яндекса и их устройства. Если микрофон на устройстве выключен кнопкой mute, запись невозможна даже в бете.

Наш приоритет — удобство пользователей, поэтому мы используем бету для проверки продуктовых гипотез. Данный алгоритм работает только в бете, и результатом его работы является уменьшение количества ложных срабатываний ассистента для всех пользователей».

Яндекс с нуля обучил полностью суверенную языковую модель

Яндекс представил Alice AI Foundation LLM — базовую версию новой языковой модели, полностью обученной с нуля. Компания самостоятельно собрала корпус, выбрала архитектуру и гиперпараметры, не используя готовые зарубежные модели.

Как сообщают «Ведомости», Alice AI Foundation содержит 80 млрд параметров и обучена на 18 трлн токенов. Благодаря архитектуре Mixture of Experts при обработке каждого токена активируются только 3 млрд параметров — весь 80-миллиардный коллектив одновременно будить не приходится. Контекстное окно достигает 262 144 токенов.

По внутренним тестам Яндекса, модель делит лидерство с Qwen3.5-35B-A3B-Base на задачах AIME 2026 и превосходит Nemotron-3-Super-120B-A12B-Base в ряде тестов на программирование, используя в четыре раза меньше активных параметров. В русскоязычных фактологических заданиях она также обошла более крупную DeepSeek-V4-Flash-Base с 284 млрд параметров. Впрочем, результаты получены на инфраструктуре самой компании и ещё нуждаются в независимой проверке.

Для оценки знаний, актуальных русскоязычной аудитории, Яндекс разработал бенчмарки WikiWebFacts и HardMultiQA. Первый проверяет знание дат, событий, определений и персоналий, второй — умение работать со сложными вопросами из медицины, права, ИТ и искусства. Наборы заданий, эталонные ответы и протоколы оценки опубликованы вместе с моделью.

Инженеры также переработали оптимизатор, совместив обмен данными между видеокартами с вычислениями и примерно вдвое ускорив шаги оптимизации. Каскад классификаторов сократил затраты на отбор обучающих документов в десятки раз, сохранив около 95% полезных материалов.

Веса, технические материалы и бенчмарки уже доступны на Hugging Face под Apache 2.0. Но это претрейн, а не готовый чат-бот: перед внедрением модель придётся дообучить и настроить. В будущем она станет полигоном для единой рассуждающей модели и ИИ-агентов «Алисы».

Яндекс называет разработку полностью суверенной, однако официальный порядок присвоения такого статуса в России заработает только в марте 2027 года.

RSS: Новости на портале Anti-Malware.ru