Blog / AMD / Llama 2 / Vulkan / benchmarking
13.93% Faster Decode on an AMD RX 6700 XT.
A Vulkan optimization increased Llama 2 7B Q4_0 decode from 75.23 to 85.71 tokens per second on one AMD RX 6700 XT.
Read postAMD Radeon RX 6700 XT · Llama 2 7B Q4_0
- control
- 75.23
- optimized
- 85.71
+13.93% decode gain