上一篇已经使用 MLX-LM 直接加载本地 Qwen3-14B-AWQ-4bit-MLX,完成中文生成测试,并把模型启动成只监听 127.0.0.1:18080 的本地 HTTP 服务。
直接加载模型适合验证模型文件和推理环境,但业务代码会
2025-11-09