Rubytech запустила российскую LLM на китайских GPU без NVIDIA

Rubytech запустила российскую LLM на китайских GPU без NVIDIA

Rubytech запустила российскую LLM на китайских GPU без NVIDIA

Группа Rubytech протестировала российскую языковую модель Cotype 3 от MWS AI на китайских графических ускорителях. Испытания проводились на программно-аппаратном комплексе «Машина искусственного интеллекта» Скала^р. Результат: модель работала стабильно, а производительность в популярных сценариях инференса оказалась сопоставима с конфигурациями на NVIDIA H100.

В тестовой системе использовались восемь китайских GPU. При обработке контекста объёмом 27 тыс. токенов среднее время генерации первого токена составило около 8 секунд, а межтокенная задержка — от 111 мс. По оценке Rubytech, этого достаточно для корпоративных ИИ-сервисов.

Но железо само себя не настроит. Инженеры адаптировали драйверы, программное окружение и средства оркестрации. В отдельных сценариях оптимизация позволила ускорить работу в 2-2,2 раза по сравнению со штатной средой китайских GPU. Контейнерная архитектура должна упростить развёртывание моделей и переход от тестов к промышленной эксплуатации.

Главный вывод испытаний — корпоративную ИИ-инфраструктуру можно строить без обязательной привязки к ускорителям NVIDIA. Особенно это актуально для госсектора, компаний с государственным участием и организаций КИИ, которым нужны локальное размещение моделей, контролируемая инфраструктура и возможность масштабироваться без лотереи с поставками H100.

Rubytech также заявляет, что китайские GPU в отдельных сценариях способны снизить совокупную стоимость владения. Правда, революцию пока придержали: речь идёт не о полном отказе от NVIDIA, а о появлении ещё одного рабочего варианта.

Дальше компания планирует испытать новое поколение китайских ускорителей и расширить список российских моделей и корпоративных ИИ-сервисов.

Android 17 начнёт тормозить и закрывать прожорливые приложения

Google расширяет в Android 17 систему индивидуальных лимитов оперативной памяти для приложений. Если программа выйдет за установленный ей бюджет, система сначала снизит её производительность, а при дальнейшем росте потребления просто завершит процесс.

Механизм дебютировал на смартфонах Pixel, но в течение ближайшего года его начнут внедрять другие производители. Ограничения появятся на устройствах с объёмом памяти от 4 до более чем 16 ГБ, сообщила Google.

На первом этапе Android принудительно переместит часть данных провинившегося приложения в zRAM — сжатую область оперативной памяти. Это позволит программе продолжить работу, но за комфорт придётся заплатить процессорным временем: данные нужно постоянно сжимать и распаковывать, поэтому интерфейс может начать дёргаться и задумываться над жизнью.

Если приложение продолжит поглощать память, система его закроет. Для пользователя это должно означать меньше ситуаций, когда одна небрежно написанная программа превращает весь смартфон в неторопливый калькулятор.

Особенно полезным механизм станет на недорогих устройствах с небольшим объёмом ОЗУ. Однако под раздачу могут попасть игры, мультимедийные редакторы и локальные ИИ-приложения, которым действительно требуется много памяти. Если разработчики не проведут оптимизацию, такие программы будут тормозить или внезапно завершаться.

Google уже добавила в Android Vitals и Firebase Crashlytics инструменты для поиска утечек памяти, отслеживания аварий и срабатываний нового ограничителя. Разработчикам предлагают заранее проверить свои приложения, пока пользователи не начали делать это вместо них единицами в магазине.

Причина ужесточения проста: смартфоны не спешат наращивать объём ОЗУ из-за подорожания памяти, а требования приложений продолжают расти.

RSS: Новости на портале Anti-Malware.ru