背景
打CTF,条件受限,最多只能携带一台设备。目标肯定是智商尽可能高
开源模型排行榜 2026/07
- Kimi K3
- GLM 5.2
- MiniMax-M3
- Deepseek V4 Pro
- MiMo-v2.5-Pro
- Kimi K2.7、K2.6
- Hy3:295B/A21B
- Nex-N2-Pro:395B
- Inkling:975B
- Deepseek V4 Flash:284B/A13B
- Nemotron 3 Ultra:550B/A55B
- MiMo-v2.5:310B/A15B
- Qwen3.6-27B:27B Dense
Nvidia CUDA 系列(主要是3090 4090 5090)
主要还是针对的5090 Laptop (5090 Mobile)显存24G,毕竟16G真的啥都跑不了。
Qwen3.6-27B (IQ4,TurboQuant)
- 实测效果(5090 Laptop 175W)
- 最大上下文:256k
- 生成速度:Prefill ~500tok/s, Decode 29~35 tok/s
- 实现:发现了这个 llama-cpp-mtp-turboquant-sm120-blackwell-windowsGithubllama-cpp-mtp-turboquant-sm120-blackwell-windowsOwnerAndgihatUpdatedJun 27, 2026
- 这个仓库编译的时候开了AVX512,导致在Core Ultra 290H上无法运行
- 手动重新编译后可以用了
- 权重量化:https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF
- 实测Q4 IQ3 IQ4都能跑
- KV量化:TurboQuant 3 / 4
- 实测可用组合:
- 权重Q4 K-turbo4 V-turbo4
- 权重Q3 K-turbo4 V-turbo4
- 权重IQ4 K-turbo4 V-turbo3
Deepseek-V4-Flash(REAP-162B,Q2)
- 实测效果(5090 Laptop 175W)
- 最大上下文:1M
- 生成速度:Prefill ~40tok/s, Decode 25~30 tok/s
- 由于prefill速度太慢,基本不可用
- 实现:
- 一开始是发现了:
- neutronstarGithubneutronstarOwnergiannisanniUpdatedJul 17, 2026ds4Githubds4OwnerantirezUpdatedJul 23, 2026
- https://huggingface.co/0xSero/DeepSeek-V4-Flash-162B-GGUF
- 这个模型删减了deepseek的expert数量,所以我按照他的修改了上面的ds4,但是效果非常差(~5tok/s)deepseek-sparkGithubdeepseek-sparkOwner0xSeroUpdatedJul 20, 2026
- 然后我发现其实用llama.cpp速度反而不错
-fit on自动 offload到内存即可
AMD GMKTec Evo X2
初始配置
本来是觉得Windows可以很轻松的配好的,但是发现windows的llama.cpp支持实在是太差了,而且总是爆出社区都没有的bug,所以我觉得还是先在Linux确定能跑了,再移回去Windows
- 按照的Ubuntu 24.04配好(我是装的26.04)strix-halo-guideGithubstrix-halo-guideOwnerhogeheer499-commitsUpdatedJul 23, 2026
sudo apt update && sudo apt upgrade -ysudo apt install vim curl wget zsh git- 没法切X11,算了:Ubuntu 26.04 LTS (released April 2026) ships with Linux 7.0, Mesa 26.0, and native
apt install rocm. However, 26.04 is Wayland-only (X11 switch above does not work) and the performance-relevant components (kernel, Mesa RADV) are already available on 24.04 via the kisak PPA and mainline kernel PPA. Upgrading is not needed for LLM performance. This guide stays on 24.04 LTS.
sudo tee -a /etc/gdm3/custom.conf > /dev/null << 'EOF' WaylandEnable=false EOF
GRUB_CMDLINE_LINUX_DEFAULT="splash amdgpu.gttsize=131072 ttm.pages_limit=31457280 amdgpu.cwsr_enable=0"sudo update-grubsudo tee /etc/modprobe.d/amdgpu_llm_optimized.conf > /dev/null << 'EOF' options amdgpu gttsize=122800 options ttm pages_limit=31457280 options ttm page_pool_size=31457280 EOF
sudo tee /etc/udev/rules.d/99-amd-kfd.rules > /dev/null << 'EOF' SUBSYSTEM=="kfd", GROUP="render", MODE="0666" SUBSYSTEM=="drm", KERNEL=="card[0-9]*", GROUP="render", MODE="0666" SUBSYSTEM=="drm", KERNEL=="renderD[0-9]*", GROUP="render", MODE="0666" EOF sudo usermod -aG render $USER sudo usermod -aG video $USER
- 性能调优
- 实测发现amd的性能管理有比较大的问题,实际拿到的设备总是自动降低GPU频率到600Mhz,没有办法,所以直接弄了个循环来持续配置
Llama.cpp的坑
在默认配置下,如果slot数量不足(并发数量不足,比如我们-np 1),llama.cpp会直接使用相似度选择kv cache,默认只要高于10%的相似度就可以通过,这在agentic场景下显然是100%触发的(因为system prompt太长了)
实测发现开启这些参数可以解决这个问题:
--kv-unified:所有的slot共用kv cache显存,而不是每个等分,这样可以np开大一点
--cache-ram 65536:让kv cache存在内存里,这样不受显存大小限制
--slot-prompt-similarity 1.00:直接相当于禁用了similar判断(因为不可能到1.0)
-np 1:虽然np理论上可以开大,但是实测中可能存在一些兼容性问题,开大了就报错