端侧LLM推理部署 (5090 Laptop & AMD Strix Halo)

大类
Env
技术标签
环境增强
优先级
Medium
状态
In Progress
开始日期
Jul 13, 2026
最后更新
Jul 18, 2026
Public

背景

打CTF,条件受限,最多只能携带一台设备。目标肯定是智商尽可能高
 

开源模型排行榜 2026/07

  • Kimi K3
  • GLM 5.2
  • MiniMax-M3
  • Deepseek V4 Pro
  • MiMo-v2.5-Pro
  • Kimi K2.7、K2.6
  • Hy3:295B/A21B
  • Nex-N2-Pro:395B
  • Inkling:975B
  • Deepseek V4 Flash:284B/A13B
  • Nemotron 3 Ultra:550B/A55B
  • MiMo-v2.5:310B/A15B
  • Qwen3.6-27B:27B Dense

Nvidia CUDA 系列(主要是3090 4090 5090)

主要还是针对的5090 Laptop (5090 Mobile)显存24G,毕竟16G真的啥都跑不了。
 

Qwen3.6-27B (IQ4,TurboQuant)

  • 实测效果(5090 Laptop 175W)
    • 最大上下文:256k
    • 生成速度:Prefill ~500tok/s, Decode 29~35 tok/s
    •  
  • KV量化:TurboQuant 3 / 4
  • 实测可用组合:
    • 权重Q4 K-turbo4 V-turbo4
    • 权重Q3 K-turbo4 V-turbo4
    • 权重IQ4 K-turbo4 V-turbo3

Deepseek-V4-Flash(REAP-162B,Q2)

  • 实测效果(5090 Laptop 175W)
    • 最大上下文:1M
    • 生成速度:Prefill ~40tok/s, Decode 25~30 tok/s
    • 由于prefill速度太慢,基本不可用
 

AMD GMKTec Evo X2

初始配置

本来是觉得Windows可以很轻松的配好的,但是发现windows的llama.cpp支持实在是太差了,而且总是爆出社区都没有的bug,所以我觉得还是先在Linux确定能跑了,再移回去Windows
  • 按照
    strix-halo-guide
    Github
    strix-halo-guide
    Owner
    hogeheer499-commits
    Updated
    Jul 23, 2026
    的Ubuntu 24.04配好(我是装的26.04)
    • sudo apt update && sudo apt upgrade -y
    • sudo apt install vim curl wget zsh git
    • 没法切X11,算了:Ubuntu 26.04 LTS (released April 2026) ships with Linux 7.0, Mesa 26.0, and native apt install rocm. However, 26.04 is Wayland-only (X11 switch above does not work) and the performance-relevant components (kernel, Mesa RADV) are already available on 24.04 via the kisak PPA and mainline kernel PPAUpgrading is not needed for LLM performance. This guide stays on 24.04 LTS.
      • sudo tee -a /etc/gdm3/custom.conf > /dev/null << 'EOF' WaylandEnable=false EOF
    • GRUB_CMDLINE_LINUX_DEFAULT="splash amdgpu.gttsize=131072 ttm.pages_limit=31457280 amdgpu.cwsr_enable=0"
    • sudo update-grub
    • sudo tee /etc/modprobe.d/amdgpu_llm_optimized.conf > /dev/null << 'EOF' options amdgpu gttsize=122800 options ttm pages_limit=31457280 options ttm page_pool_size=31457280 EOF
      sudo tee /etc/udev/rules.d/99-amd-kfd.rules > /dev/null << 'EOF' SUBSYSTEM=="kfd", GROUP="render", MODE="0666" SUBSYSTEM=="drm", KERNEL=="card[0-9]*", GROUP="render", MODE="0666" SUBSYSTEM=="drm", KERNEL=="renderD[0-9]*", GROUP="render", MODE="0666" EOF sudo usermod -aG render $USER sudo usermod -aG video $USER
  • 性能调优
    • 实测发现amd的性能管理有比较大的问题,实际拿到的设备总是自动降低GPU频率到600Mhz,没有办法,所以直接弄了个循环来持续配置

Llama.cpp的坑

在默认配置下,如果slot数量不足(并发数量不足,比如我们-np 1),llama.cpp会直接使用相似度选择kv cache,默认只要高于10%的相似度就可以通过,这在agentic场景下显然是100%触发的(因为system prompt太长了)
实测发现开启这些参数可以解决这个问题:
  • --kv-unified:所有的slot共用kv cache显存,而不是每个等分,这样可以np开大一点
  • --cache-ram 65536:让kv cache存在内存里,这样不受显存大小限制
  • --slot-prompt-similarity 1.00 :直接相当于禁用了similar判断(因为不可能到1.0)
  • -np 1:虽然np理论上可以开大,但是实测中可能存在一些兼容性问题,开大了就报错