Аппаратная архитектура A5X: инференс на новый уровень
На конференции Google Cloud Next Google и NVIDIA представили новую аппаратную платформу A5X — бескомпромиссное решение для снижения стоимости инференса искусственного интеллекта в масштабе. Новые bare-metal инстансы работают на базе rack-scale систем NVIDIA Vera Rubin NVL72 и благодаря совместному проектированию аппаратного и программного обеспечения (hardware-software codesign) обеспечивают до десяти раз меньшую стоимость инференса на токен по сравнению с предыдущими поколениями. Одновременно архитектура достигает десятикратного роста пропускной способности токенов на мегаватт.
Масштабные развёртывания требуют колоссальной пропускной способности сети, чтобы избежать задержек при обработке данных. A5X-инстансы решают эту задачу за счёт связки NVIDIA ConnectX-9 SuperNIC с сетевой технологией Google Virgo. Конфигурация способна масштабироваться до 80 000 GPU NVIDIA Rubin в пределах одного кластера площадки и до 960 000 GPU при межцентровом развёртывании. Управление такой плотностью параллельных процессоров требует точной синхронизации маршрутизации данных, чтобы исключить простой вычислительных ресурсов.
Конфиденциальные вычисления и защита данных
Для регулируемых отраслей — финансового сектора и здравоохранения — вопросы управления данными остаются критическими. Требования к суверенитету данных и риски раскрытия проприетарной информации нередко останавливают проекты в области машинного обучения. В ответ Google и NVIDIA вывели модели Gemini, работающие на GPU NVIDIA Blackwell и Blackwell Ultra, на этап превью в Google Distributed Cloud. Такой подход позволяет организациям размещать передовые модели полностью в контролируемой среде совместно с наиболее чувствительными хранилищами данных.
Архитектура включает NVIDIA Confidential Computing — протокол аппаратного уровня безопасности, который гарантирует, что обучение моделей происходит в защищённом окружении, где промпты и данные тонкой настройки остаются зашифрованными. Шифрование исключает доступ неавторизованных сторон, включая операторов облачной инфраструктуры, к исходным данным. Для мультитенантных публичных облачных сред также представлен превью-релиз Confidential G4 VMs с GPU NVIDIA RTX PRO 6000 Blackwell — это первое облачное решение для конфиденциальных вычислений на базе GPU NVIDIA Blackwell, предоставляющее регулируемым отраслям доступ к высокопроизводительному оборудованию без нарушения стандартов защиты данных.
Агентные системы и управляемое обучение
Создание многошаговых агентных систем требует сложной интеграции больших языковых моделей с API, непрерывной синхронизации векторных баз данных и активной борьбы с алгоритмическими галлюцинациями. Для упрощения этой инженерной задачи NVIDIA Nemotron 3 Super теперь доступен на платформе Gemini Enterprise Agent Platform. Платформа предоставляет разработчикам инструменты для кастомизации и развёртывания моделей рассуждений и мультимодальных моделей, специально спроектированных для агентных задач. Широкая платформа NVIDIA на Google Cloud оптимизирована для различных моделей, включая семейства Google Gemini и Gemma, что даёт разработчикам инструменты для построения систем, способных рассуждать, планировать и действовать.
Обучение таких моделей в масштабе создаёт значительную операционную нагрузку, особенно при управлении размером кластеров и восстановлении после аппаратных сбоев в ходе длительных циклов обучения с подкреплением. Google Cloud и NVIDIA представили Managed Training Clusters на платформе Gemini Enterprise Agent Platform с управляемым API обучения с подкреплением на базе NVIDIA NeMo RL. Система автоматизирует подбор размера кластера, восстановление после сбоев и выполнение задач, позволяя командам data science сосредоточиться на качестве моделей, а не на низкоуровневом управлении инфраструктурой.
Практические кейсы и перспективы
CrowdStrike активно использует открытые библиотеки NVIDIA NeMo, включая NeMo Data Designer и NeMo Megatron Bridge, для генерации синтетических данных и тонкой настройки моделей под специфические задачи кибербезопасности. Запуск этих моделей на Managed Training Clusters с GPU Blackwell ускоряет возможности автоматического обнаружения и реагирования на угрозы.
Интеграция машинного обучения в тяжёлую промышленность и производство ставит перед инженерами особые задачи: подключение цифровых моделей к физическим производственным линиям требует точного физического моделирования, огромных вычислительных мощностей и стандартизации устаревших форматов данных. Как отмечает вице-президент и генеральный менеджер Google Cloud по инфраструктуре ИИ и вычислений Марк Ломейер: «Мы убеждены, что следующее десятилетие ИИ будет определяться способностью клиентов запускать свои наиболее ресурсоёмкие рабочие нагрузки на по-настоящему интегрированной, оптимизированной для ИИ инфраструктурной стеке». Объединяя масштабируемую инфраструктуру Google Cloud и управляемые ИИ-сервисы с отраслевыми платформами, системами и программным обеспечением NVIDIA, компании предоставляют клиентам гибкость для обучения, тонкой настройки и развёртывания моделей — от передовых и открытых до агентных и физических ИИ-нагрузок — с оптимизацией по производительности, стоимости и устойчивости.
