Nvidia đang bắt đầu đưa công nghệ chip Groq vào các trung tâm dữ liệu AI thương mại, chỉ vài tháng sau khi chi 20 tỷ USD để mua các tài sản của startup chip này. Động thái cho thấy Nvidia không chỉ tiếp tục đặt cược vào GPU mà còn muốn chiếm vị trí trong một phân khúc ngày càng quan trọng của điện toán AI: suy luận độ trễ thấp, nơi tốc độ phản hồi quyết định trải nghiệm của các tác nhân AI.
Nvidia hôm thứ Hai cho biết hệ thống Groq 3 LPX đã bước vào sản xuất hàng loạt và sẽ được triển khai tại Nebius, một nhà cung cấp dịch vụ đám mây chuyên về AI. Hệ thống dự kiến đi vào hoạt động vào cuối năm nay, cùng với bộ xử lý trung tâm Vera và bộ xử lý đồ họa Rubin của Nvidia.
Sự xuất hiện của Groq 3 LPX đánh dấu bước chuyển từ việc Nvidia mua lại công nghệ của Groq sang đưa công nghệ này vào hoạt động trong hạ tầng AI thực tế. Nvidia kỳ vọng chip Groq sẽ xử lý những tác vụ mà tốc độ phản hồi quan trọng hơn khả năng tính toán đa dụng của GPU, đặc biệt là các tác vụ lập trình và vận hành tác nhân AI.
Bổ sung một mảnh ghép cho GPU
Sự phát triển nhanh của các tác nhân AI đang tạo ra nhu cầu mới đối với phần cứng. Không giống các mô hình chỉ tạo một câu trả lời đơn lẻ, tác nhân AI có thể liên tục nhận yêu cầu, suy luận, gọi công cụ và tạo ra nhiều lượt phản hồi. Độ trễ trong từng bước có thể khiến toàn bộ quá trình trở nên chậm chạp đối với người dùng.
Đây là vấn đề mà các chip như Groq nhắm tới.
Các chip Groq chủ yếu xử lý giai đoạn ‘giải mã’ trong quá trình AI tạo câu trả lời, khi mô hình lần lượt sinh ra từng đơn vị văn bản (token). Mục tiêu là rút ngắn thời gian chờ giữa các đơn vị này, giúp AI phản hồi nhanh và mượt hơn.
Dion Harris, Giám đốc cấp cao của Nvidia, cho biết công nghệ này có thể giúp các nhà cung cấp dịch vụ đám mây tạo ra những gói dịch vụ cao cấp dành cho khách hàng yêu cầu khả năng phản hồi đặc biệt nhanh.
“Đối với những đơn vị cung cấp token, công nghệ này mở ra khả năng cung cấp các gói dịch vụ cao cấp cho những người dùng và khách hàng thực sự yêu cầu các thỏa thuận dịch vụ có độ nhạy cao về độ trễ,” Harris nói.
Quan trọng hơn, Nvidia không xem Groq là sản phẩm thay thế GPU.
“Điều này không nhằm thay thế GPU,” Harris nói. “Mục tiêu là sử dụng mức giá phù hợp và bộ xử lý phù hợp cho từng phần phù hợp của khối lượng công việc.”
GPU vẫn là nền tảng chính của điện toán AI vì có thể đảm nhiệm cả huấn luyện lẫn suy luận và đủ linh hoạt để thích ứng với những mô hình, thuật toán và công nghệ mới. Groq được Nvidia định vị như một bộ xử lý chuyên dụng cho một phần cụ thể của quá trình phục vụ mô hình.
Thương vụ 20 tỷ USD bắt đầu phát huy tác dụng
Nvidia mua các tài sản của startup Groq với giá 20 tỷ USD vào tháng 12/2025, trong thương vụ lớn nhất từ trước đến nay của công ty.
Việc Groq 3 LPX hiện bước vào sản xuất hàng loạt cho thấy Nvidia đang nhanh chóng biến công nghệ thu được từ thương vụ thành một sản phẩm thương mại.
Kiến trúc Groq tích hợp 500 MB bộ nhớ SRAM tốc độ cao ngay trên chip, nhằm giảm các nút thắt do việc truy xuất bộ nhớ gây ra.
Các chip Groq do Samsung sản xuất theo hợp đồng, trong khi GPU Nvidia được sản xuất bởi Taiwan Semiconductor Manufacturing (TSMC).
Nvidia tích hợp 256 chip Groq 3 vào mỗi hệ thống rack LPX. Theo Nvidia, hệ thống này có thể đạt tốc độ 3.400 token/giây, dựa trên kết quả đánh giá của Artificial Analysis.
Hệ thống đầu tiên sẽ được triển khai tại Nebius. Groq 3 LPX sẽ hoạt động cùng các hệ thống Vera và Rubin, cho thấy Nvidia đang xây dựng một hạ tầng kết hợp giữa các bộ xử lý chuyên dụng thay vì dựa hoàn toàn vào một loại chip.
Cuộc đua suy luận độ trễ thấp
Nvidia không phải công ty duy nhất nhận thấy cơ hội trong lĩnh vực này.
AMD hồi đầu năm cho biết sẽ tích hợp các hệ thống quy mô lớn với chip của Cerebras, một công ty chuyên về suy luận AI độ trễ thấp và vừa lên sàn.
OpenAI cũng đang cung cấp chế độ Ultrafast, với tốc độ được công bố lên tới 750 token/giây và sử dụng công nghệ của Cerebras.
Điều này cho thấy thị trường chip AI đang phân hóa mạnh hơn. Nếu GPU từng được xem là phần cứng gần như mặc định cho mọi khâu của AI, sự phát triển của các tác nhân AI đang tạo thêm nhu cầu đối với những bộ xử lý được tối ưu cho từng loại tác vụ.
Đối với Nvidia, Groq cho phép công ty tham gia trực tiếp vào phân khúc này mà không cần từ bỏ lợi thế cốt lõi là GPU.
Groq nằm ở đâu trong chiến lược Vera Rubin?
Nvidia hiện cũng đang tăng tốc giao các hệ thống Vera Rubin, bắt đầu được sản xuất từ đầu năm.
Tại sự kiện công bố Vera Rubin và Groq 3 LPX hồi tháng 3, CEO Jensen Huang dự báo doanh thu tích lũy từ chip Blackwell thế hệ hiện tại và hệ thống Vera Rubin mới sẽ đạt 1.000 tỷ USD vào năm 2027. Huang khi đó cho biết Nvidia sẽ dành khoảng một phần tư diện tích trung tâm dữ liệu phục vụ các ứng dụng lập trình cho chip Groq.
“Phần còn lại của trung tâm dữ liệu của tôi sẽ hoàn toàn là Vera Rubin,” ông nói.
Thông điệp này cho thấy Nvidia coi Groq là một lớp phần cứng bổ sung. Trong một trung tâm dữ liệu AI, GPU có thể đảm nhiệm những công việc tính toán lớn và đa dạng, trong khi chip Groq xử lý những phần cần tốc độ phản hồi cao.
Nếu mô hình này được triển khai ở quy mô lớn, thương vụ Groq trị giá 20 tỷ USD có thể trở thành một bước đi quan trọng trong chiến lược của Nvidia nhằm kiểm soát không chỉ chip huấn luyện AI, mà cả phần hạ tầng chuyên biệt cần thiết để đưa các tác nhân AI vào sử dụng hàng ngày.

Chip xử lý Groq 3 LPU của Nvidia được giới thiệu tại hội nghị Nvidia GTC ở San Jose, California, ngày 18/3/2026. Ảnh: Bloomberg

