Phi-4

1

Qwen3+Phi-4 消费显卡实测:32B 模型在 4090/5090/M4 Pro 跑出 78 tok/s

6 月底到 7 月初,本地大模型生态出现了三个肉眼可见的拐点:一是 Qwen 团队连续放出 Qwen3-32B 和 Qwen3-Next 80B 的本地友好权重,32B 模型在 24GB 显存上第一次实现全精度运行;二是微软 Phi-4 14B 用 14B 的小钢炮体量,跑分压过了一票 70B 模型;三是 arxiv 在 7 月初挂出的 Wiola 架构论文,把”小模型高效推理&#82…