Robuta

https://docs.vllm.ai/en/stable/api/vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe/ trtllm_fp8_moe - vLLM moevllm https://forums.developer.nvidia.com/t/issue-qwen3-next-80b-nvfp4-and-fp8-cannot-be-served-via-trtllm-serve-on-dgx-spark-gb10-trt-llm-1-3-0rc7/363540 [Issue] Qwen3-Next-80B NVFP4 and FP8 Cannot Be Served via trtllm-serve on DGX Spark GB10 (TRT-LLM... Mar 15, 2026 - ## Summary I have been attempting to serve **Qwen3-Next-80B-A3B-Thinking** (both NVFP4 and FP8 variants) via `trtllm-serve` on a single DGX Spark GB10 (128GB...