Rubytech запустила российскую LLM на китайских GPU без NVIDIA

Rubytech запустила российскую LLM на китайских GPU без NVIDIA

Rubytech запустила российскую LLM на китайских GPU без NVIDIA

Группа Rubytech протестировала российскую языковую модель Cotype 3 от MWS AI на китайских графических ускорителях. Испытания проводились на программно-аппаратном комплексе «Машина искусственного интеллекта» Скала^р. Результат: модель работала стабильно, а производительность в популярных сценариях инференса оказалась сопоставима с конфигурациями на NVIDIA H100.

В тестовой системе использовались восемь китайских GPU. При обработке контекста объёмом 27 тыс. токенов среднее время генерации первого токена составило около 8 секунд, а межтокенная задержка — от 111 мс. По оценке Rubytech, этого достаточно для корпоративных ИИ-сервисов.

Но железо само себя не настроит. Инженеры адаптировали драйверы, программное окружение и средства оркестрации. В отдельных сценариях оптимизация позволила ускорить работу в 2-2,2 раза по сравнению со штатной средой китайских GPU. Контейнерная архитектура должна упростить развёртывание моделей и переход от тестов к промышленной эксплуатации.

Главный вывод испытаний — корпоративную ИИ-инфраструктуру можно строить без обязательной привязки к ускорителям NVIDIA. Особенно это актуально для госсектора, компаний с государственным участием и организаций КИИ, которым нужны локальное размещение моделей, контролируемая инфраструктура и возможность масштабироваться без лотереи с поставками H100.

Rubytech также заявляет, что китайские GPU в отдельных сценариях способны снизить совокупную стоимость владения. Правда, революцию пока придержали: речь идёт не о полном отказе от NVIDIA, а о появлении ещё одного рабочего варианта.

Дальше компания планирует испытать новое поколение китайских ускорителей и расширить список российских моделей и корпоративных ИИ-сервисов.

Диспетчер задач Windows 11 научился вычислять пожирателей NPU

Microsoft расширила функциональность Диспетчера задач Windows 11 новыми инструментами для контроля ИИ-нагрузки. Теперь пользователи смогут увидеть не только общую активность нейропроцессора, но и конкретные приложения, которые занимают NPU и расходуют его память.

На страницах «Процессы», «Пользователи» и «Подробности» появились необязательные столбцы NPU и NPU Engine.

В разделе «Подробности» также можно включить показатели выделенной и общей памяти нейропроцессора. Это поможет выяснить, какое приложение действительно запускает локальный ИИ, а какое просто громко пишет об этом в рекламе.

Нейронные блоки, встроенные в GPU, теперь отображаются на странице «Производительность». Если программа использует специализированный ускоритель видеокарты, Диспетчер задач покажет GPU — Neural. Работа через NPU может обозначаться как NPU — Compute или NPU — Neural — название зависит от процессора и драйвера.

Новые метрики позволяют быстро заметить плохо оптимизированные приложения. Если программа активно жарит CPU, а NPU простаивает и отметка GPU — Neural отсутствует, значит, ИИ-задача, вероятно, выполняется программно. Результат предсказуем: ниже скорость, выше энергопотребление и перегревшийся ноутбук.

Дополнительно Microsoft добавила столбец Isolation. Он показывает, какие приложения запущены в изолированной среде AppContainer.

Все новые показатели скрыты по умолчанию. Включить их можно щелчком правой кнопки мыши по заголовкам таблицы. Изменения описаны в официальном обновлении Windows 11.

RSS: Новости на портале Anti-Malware.ru