别再盲目下载了!这个GitHub开源工具,3秒测出你的电脑最适合跑哪个AI大模型
- 2026-09-19 12:43:38
本地跑大模型这件事,听起来挺美的。拉个模型下来,断网也能跟AI聊天,数据还留在自己手里,安全感拉满。
可真干起来,坑一个接一个。模型多到眼花,Llama、Qwen、Mistral、Phi……每个系列还有七八种尺寸、十几种量化版本。下了一个70B的,发现显存塞不下;换个小点的,速度又慢得像蜗牛;好不容易跑起来了,效果还不如网页版免费模型。
参数越大越好?量化越低越省?这些经验在真实硬件面前,经常翻车。
这时候就得聊聊 WhichLLM 这个开源小工具了。它不会给你画大饼,也不会推荐那些"理论上能跑"的模型。它的逻辑很简单:先看清你的硬件底子,再从HuggingFace的海量模型里,挑出真正跑得动、跑得快、效果还顶的那几款。
它到底怎么帮你省事的
WhichLLM 的核心就一句话:用真实基准说话,而不是看参数大小拍脑袋。
它背后接了一堆权威评测数据源——LiveBench、Chatbot Arena ELO、Aider、Artificial Analysis 这些。更关键的是,它会给每个分数打"可信度标签":直接测过的、变体推断的、基础模型继承的、还是上传者自己吹的。来源越虚,权重越低,直接帮你过滤掉那些水分大的推荐。
而且它懂"新老交替"。一个2024年的老模型,就算当年分数高,也不会压过新一代的表现。基准测试的时间戳都给你标得明明白白,过时推荐藏不住。
硬件检测这块也做得挺细。N卡、A卡、苹果M系列、纯CPU,它都能自动识别。显存多大、内存带宽多少、磁盘空间够不够,全给你扫描一遍。不是简单看个"能不能装下",而是把权重、KV缓存、激活层、框架开销全算进去,估算得相当实在。
安装?一行命令搞定
这项目作者显然很懂现代人怕麻烦的心态。安装路径给得足足的,挑一个顺手的就行。
最推荐的方式,零配置尝鲜:
uvx whichllm@latest连安装都省了,直接跑。试完觉得不错,再正式装上:
uv tool install whichllm或者用 pip:
pip install whichllmMac用户还能用 Homebrew:
brew install andyyyy64/whichllm/whichllm对,它还支持 pipx 安装,喜欢隔离环境的朋友也能玩得转。Python 版本要求 3.11 以上,这个大部分新系统都满足了。
装完以后,终端里敲 whichllm 三个字,它就开始干活了。
基础用法,小白也能秒懂
先看看你的机器能跑啥:
whichllm它会自动检测你的GPU、CPU、内存,然后列出一个排名表。大概长这样:
#1 Qwen/Qwen3.6-27B 27.8B Q5_K_M score 92.8 27 t/s#2 Qwen/Qwen3-32B 32.0B Q4_K_M score 83.0 31 t/s注意看,32B的模型虽然也能塞进你的显存,但WhichLLM把27B排在了第一。原因是27B更新、综合基准更好,实际体验反而更香。这就是它和那些"只看大小"的工具最大的区别。
想换显卡?先模拟一下:
whichllm --gpu "RTX 4090"不用真买,先过过干瘾。看看换了卡以后能跑什么水平的模型,心里有底再下单。
只想看完全塞进显存的,不玩内存 offload:
whichllm --gpu-only或者加个速度门槛,太慢的不要:
whichllm --speed usableusable 是至少10 tok/s,fast 是至少30 tok/s。想要更精细的控制,也可以直接写:
whichllm --min-speed 20进阶玩法,老鸟也能玩出花
多卡工作站也能模拟:
whichllm --gpu "2x RTX 4090"或者混插不同型号:
whichllm --gpu "RTX 4090" --gpu "RTX 3090"反向查询:我想跑某个模型,需要什么硬件?
whichllm plan "llama 3 70b"它会告诉你大概需要什么级别的显卡、多少显存。再也不用对着模型页瞎猜了。
升级对比,纠结党福音:
whichllm upgrade "RTX 4090""RTX 5090""H100"把现有卡和候选卡摆在一起,看看推荐模型能跳多少档,升级值不值一目了然。
按场景过滤,不瞎推荐:
whichllm --profile coding # 写代码用whichllm --profile vision # 看图用whichllm --profile math # 做数学题用输出格式也能调:
想要贴到GitHub issue、Slack、Discord?加 --markdown:
whichllm --markdown想接脚本流水线?加 --json:
whichllm --top 1 --json配合 jq 食用,自动化选型不要太爽。
最骚的操作:一句话跑起来聊天
找到模型还不够,WhichLLM 直接帮你跑起来。
whichllm run它自动挑一个最适合你当前硬件的模型,下载、配置、启动对话,一气呵成。连模型格式都不用你操心,GGUF、AWQ、GPTQ、FP16 它都支持。
想指定模型也行:
whichllm run "qwen 2.5 1.5b gguf"纯CPU环境也能玩:
whichllm run "phi 3 mini gguf" --cpu-only不想聊天,想要代码?
whichllm snippet "qwen 7b"直接吐一段可复制的Python代码出来,贴进你的项目就能跑。对开发者来说,这功能能省不少查文档的时间。
几个贴心的小细节
WhichLLM 默认是有点"激进"的——它会推荐那些看起来能跑、包括部分内存卸载或者显存边缘 fitting 的模型。如果你跟 LM Studio 那种保守风格,可以加几个参数让它稳一点:
whichllm --gpu-only --speed usable --vram-headroom 1GB这样只推荐完全塞进显存的,速度够用的,还留1GB余量给运行时波动。如果 LM Studio 还是报略超,就把余量加到1.5GB。
缓存机制也做得挺合理。模型列表缓存6小时,基准数据缓存24小时。平时用着够快,想强制刷新就加 --refresh。
写在最后
本地跑大模型这件事,选型环节其实比运行环节更让人头大。WhichLLM 就是把这块硬骨头啃了下来,让你从"下载→报错→删了重下"的循环里解脱出来。
它没花哨的界面,就一行命令,但给的建议足够扎实。作者还在GitHub上喊话说,希望大家跑完以后把结果贴到 Issues 里,他很想知道大家的机器都配到了什么模型。这种互动感,挺有人情味的。
如果你也在本地折腾LLM,不妨花两分钟装一个试试。说不定你会发现,你显卡的真实实力,比你想象的要强不少。
GitHub地址:https://github.com/Andyyyy64/whichllm