想在自己的电脑上跑大模型,最费时间的往往不是安装,而是安装前的选择:模型看着合适,下载后才发现内存不够,或者速度慢得难用。llmfit 把这一步压缩成一条命令。它检测电脑的 RAM(内存)、CPU、GPU 和 VRAM(显存),再从数百个模型与服务商方案中,按能否装下、预计速度、质量和上下文能力排序。
工具默认提供 TUI——运行在终端里的交互式界面,也支持普通命令行和 JSON 输出,方便脚本调用。它还能处理多 GPU、MoE(只启用部分参数的混合专家模型)和不同量化方案,并适配 Ollama、llama.cpp、MLX、LM Studio 等本地运行工具。
更值得注意的是,llmfit 正把“估算”换成用户机器上的实测:下载并运行模型后,它可测量每秒生成多少 token(模型处理文字的基本单位),结果先保存在本地,也能从 TUI 直接作为 PR——提交给项目维护者的一组改动——贡献回仓库。合并后,相同硬件的用户可在下次发布中看到实测数据。不过基准测试只代表特定机器与设置,不能保证所有人的表现一致。