Бесплатный шрифт ShieldFont научился защищать сайты от сбора данных для ИИ

Бесплатный шрифт ShieldFont научился защищать сайты от сбора данных для ИИ

Бесплатный шрифт ShieldFont научился защищать сайты от сбора данных для ИИ

Публикация текста в интернете теперь означает не только встречу с читателями, но и незваный визит ИИ-ботов, которые могут утащить материал в обучающий датасет. Просьбу не заходить через robots.txt они соблюдают не всегда, поэтому создатели ShieldFont решили действовать хитрее: пустить скрейперы внутрь и подсунуть им убедительную чепуху.

Бесплатный шрифт разработали бразильское агентство Seneda & Abrucio и датская студия Playtype.

В браузере человек видит исходный текст, а бот при анализе кода получает другую версию. Для этого ShieldFont использует механизм замены глифов OpenType, но меняет не отдельные символы, а целые слова.

Подмена происходит не хаотично. Существительные заменяются существительными, глаголы прошедшего времени — такими же глаголами, а множественное число сохраняется. Словарь разделён на 250 групп с учётом частей речи и смысловых признаков. В результате шрифт переставляет примерно четверть слов, сохраняя грамматически приличный вид текста.

 

Это нужно, чтобы отравленная версия не вылетела из обучающего набора на первом же фильтре качества. Разработчики проверили её с помощью FineWeb-Edu: около 10% фрагментов, признанных качественными до защиты, прошли отбор и после неё. Текст оставался достаточно связным для сохранения, но уже врал по существу. В 55,8% протестированных отрывков факты не совпадали с оригиналом.

Непробиваемым щитом ShieldFont всё же не стал. Если сделать скриншот страницы и распознать надписи через OCR, исходный текст можно восстановить. Есть и проблема посерьёзнее: скринридеры для незрячих тоже считывают подменённые слова. Разработчики добавили бета-функцию для передачи им оригинального текста, но вопрос доступности пока полностью не закрыт.

Сейчас ShieldFont работает только с английским языком и бесплатно доступен на GitHub.

Яндекс с нуля обучил полностью суверенную языковую модель

Яндекс представил Alice AI Foundation LLM — базовую версию новой языковой модели, полностью обученной с нуля. Компания самостоятельно собрала корпус, выбрала архитектуру и гиперпараметры, не используя готовые зарубежные модели.

Как сообщают «Ведомости», Alice AI Foundation содержит 80 млрд параметров и обучена на 18 трлн токенов. Благодаря архитектуре Mixture of Experts при обработке каждого токена активируются только 3 млрд параметров — весь 80-миллиардный коллектив одновременно будить не приходится. Контекстное окно достигает 262 144 токенов.

По внутренним тестам Яндекса, модель делит лидерство с Qwen3.5-35B-A3B-Base на задачах AIME 2026 и превосходит Nemotron-3-Super-120B-A12B-Base в ряде тестов на программирование, используя в четыре раза меньше активных параметров. В русскоязычных фактологических заданиях она также обошла более крупную DeepSeek-V4-Flash-Base с 284 млрд параметров. Впрочем, результаты получены на инфраструктуре самой компании и ещё нуждаются в независимой проверке.

Для оценки знаний, актуальных русскоязычной аудитории, Яндекс разработал бенчмарки WikiWebFacts и HardMultiQA. Первый проверяет знание дат, событий, определений и персоналий, второй — умение работать со сложными вопросами из медицины, права, ИТ и искусства. Наборы заданий, эталонные ответы и протоколы оценки опубликованы вместе с моделью.

Инженеры также переработали оптимизатор, совместив обмен данными между видеокартами с вычислениями и примерно вдвое ускорив шаги оптимизации. Каскад классификаторов сократил затраты на отбор обучающих документов в десятки раз, сохранив около 95% полезных материалов.

Веса, технические материалы и бенчмарки уже доступны на Hugging Face под Apache 2.0. Но это претрейн, а не готовый чат-бот: перед внедрением модель придётся дообучить и настроить. В будущем она станет полигоном для единой рассуждающей модели и ИИ-агентов «Алисы».

Яндекс называет разработку полностью суверенной, однако официальный порядок присвоения такого статуса в России заработает только в марте 2027 года.

RSS: Новости на портале Anti-Malware.ru