sergio@b70-lab:~$ xpu-smi discovery --dump 1,2,18,20,22
| Device ID | Device Name | PCI BDF | Visible VRAM | Memory Bandwidth | Max Power (TBP) |
| 0 | Intel(R) Arc(TM) Pro B70 GPU | 0000:03:00.0 | 32,656 MiB | 608 GB/s (GDDR6) | 230 W (Cap: 150 W) |
| 1 | Intel(R) Arc(TM) Pro B70 GPU | 0000:07:00.0 | 32,656 MiB | 608 GB/s (GDDR6) | 230 W (VideoGen Node) |
sergio@b70-lab:~$ docker run --rm -it --device /dev/dri:/dev/dri --ipc=host \
-v /models:/models -e ONEAPI_DEVICE_SELECTOR=level_zero:0 \
vllm/vllm-openai-xpu@sha256:f01e24f6... \
--model /models/Qwen3.8-27B-GPTQ-Int4-sym-G128-MTP-BF16 \
--kv-cache-dtype fp8 --gpu-memory-utilization 0.88 --max-model-len 100000
INFO 08-27 18:20:01 [xpu_executor.py:104] Initialized XPU backend on Intel Arc Pro B70 (BMG-31)
INFO 08-27 18:20:04 [speculative.py:214] MTP draft tensor overlay loaded · 4 speculative tokens
INFO 08-27 18:20:07 [server.py:82] Uvicorn running on http://0.0.0.0:8000 (VRAM resident: 18.2 GiB)
sergio@b70-lab:~$ ./llama-bench -m /models/Muse-Glimmer-30B-Q4_K_M.gguf \
-p 512,2048 -n 128 -t 8 -ngl 99 -fa 1 -ctk q8_0 -ctv q4_1 -r 5
| Model | Backend | Threads | Test | Prompt Tokens | Gen Tokens | Rate (tok/s) |
| Muse-Glimmer-30B | SYCL (XPU0) | 8 | pp512 | 512 | 0 | 3,240.5 ± 21.3 |
| Muse-Glimmer-30B | SYCL (XPU0) | 8 | tg128 | 512 | 128 | 42.8 ± 0.4 |
| Muse-Glimmer-30B | SYCL (XPU0) | 8 | pp2048 | 2048 | 0 | 2,890.1 ± 18.7 |
| Muse-Glimmer-30B | SYCL (XPU0) | 8 | tg128 | 2048 | 128 | 41.6 ± 0.3 |