

⚡ Nvidia ghép CPU Vera với GPU Rubin, chạy AI agent nhanh gấp 30 lần
Nvidia không chỉ bán GPU nữa. Hãng vừa tung ra một cỗ máy phần cứng thiết kế riêng cho AI agent, từ đầu tới cuối.
🧩 Vera lo điều phối, Rubin lo suy luận
Nền tảng mới của Nvidia ghép hai chip: CPU Vera với 88 nhân tùy chỉnh kiến trúc Arm, và GPU Rubin chuyên suy luận model. Vera xử lý phần việc mà AI agent cần nhiều nhất: điều phối tác vụ, gọi tool, quản lý context, và tạo sandbox để agent chạy an toàn. Rubin chỉ tập trung suy luận model AI, không phải lo việc orchestration. Hai chip nối với nhau qua NVLink-C2C, băng thông lên tới 1,8 terabyte mỗi giây, nhanh hơn nhiều so với kết nối PCIe truyền thống.
📦 Một rack chạy hơn 22.500 sandbox cùng lúc
Mỗi rack server tích hợp 256 CPU Vera, đủ sức hỗ trợ hơn 22.500 sandbox chạy đồng thời. Đây là con số quan trọng với các công ty đang vận hành hàng nghìn AI agent song song, vì mỗi agent cần một sandbox riêng để gọi tool và xử lý dữ liệu mà không đụng nhau.
🚀 Hiệu quả tăng 30 lần trên mỗi megawatt
Hệ thống Vera Rubin NVL72 đạt thông lượng cao gấp 30 lần trên mỗi megawatt so với thế hệ GB300 NVL72 trước đó, khi chạy các workload agentic. Với các trung tâm dữ liệu đang chịu áp lực về điện năng, con số này quyết định trực tiếp bạn có thể chạy bao nhiêu agent trong cùng một ngân sách điện.
🔧 Vì sao dev nên quan tâm
Nếu bạn build sản phẩm dùng nhiều AI agent gọi tool liên tục, tốc độ orchestration thường là nút thắt cổ chai thực sự, không phải tốc độ model. Việc Nvidia tách riêng phần cứng cho orchestration khỏi phần cứng suy luận cho thấy ngành đang thiết kế hạ tầng theo đúng cách agent hoạt động, thay vì cố nhồi mọi thứ vào một loại chip.
Bạn nghĩ phần cứng chuyên biệt cho AI agent có phải xu hướng bắt buộc trong 2 năm tới không?


