范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「本地部署大模型服务」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。
问题从哪来
本教程将介绍在 macOS 和 Windows 环境下部署本地大模型服务。如无特殊说明,macOS 系统下需在终端中执行命令,Windows 系统下需要在 PowerShell 中执行命令。本教程涉及到的软件和模型信息如下:
echo "HF_ENDPOINT=https://hf-mirror.com" >> ~/.bash_profile Windows [ Environment ]:: SetEnvironmentVariable ( "HF_ENDPOINT" , "https://hf-mirror.com" , "User" ) 更多使用方式可参考 HF-Mirror 官方网站。
方法怎么选
curl -fsSL https://ollama.com/install.sh | sh Windows irm https : // ollama . com / install . ps1 | iex 运行如下命令可以显示当前安装的版本号:
ollama –version # ollama version is 0.20.2 ollama 当前采用 ollama pull MODEL 命令下载模型,除了使用 官方模型库 中的模型名称外(例如: qwen3.5:27b-nvfp4 ),还可以使用 Hugging Face 的模型链接(例如: https://huggingface.co/lmstudio-community/Qwen3.5-27B-GGUF ),运行如下命令下载模型:
落地时先钉死的事
ollama pull qwen3.5:27b-nvfp4 ollama pull https://huggingface.co/lmstudio-community/Qwen3.5-27B-GGUF ollama 当前仅支持通过环境变量配置监听地址和端口,运行如下命令进行配置:
echo "OLLAMA_HOST=0.0.0.0:11434" >> ~/.bash_profile Windows [ Environment ]:: SetEnvironmentVariable ( "OLLAMA_HOST" , "0.0.0.0:11434" , "User" ) 运行如下命令启动模型服务:
检查清单
ollama run <模型名称> Windows ollama run < 模型名称 > 提示 ollama 默认会选择最适合的运行库,如果需要切换可以手动指定 LLM 运行库,运行如下命令表示使用 CPU 进行推理:
OLLAMA_LLM_LIBRARY="cpu_avx2" ollama serve <模型名称> 注意 在 Settings 中将 Context length 设置为最大值,以确保在后续使用过程中不会因上下文长度不足而导致效果下降。 macOS Windows 打开 ollama 主页面,选择对应的模型,即可开始对话:
落地时建议先做的 5 件事
- 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
- 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
- 多智能体只在单智能体触到上下文或专业边界时再拆。
- Token、微调和压缩都要有对照数字,避免口号式优化。
- 结论写成可检查清单:接口、超时、评测集、回滚版本。
和智能体产品怎么接
龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:本教程将介绍在 macOS 和 Windows 环境下部署本地大模型服务。如无特殊说明,macOS 系统下需在终端中执行命令,Windows 系统下需要在 PowerShell 中执行命令。本教程涉及到的软件和模型信息如下: 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:本教程将介绍在 macOS 和 Windows 环境下部署本地大模型服务。如无特殊说明,macOS 系统下需在终端中执行命令,Windows 系统下需要在 PowerShell 中执行命令。本教程涉及到的软件和模型信息如下:
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。;2) 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。;3) 多智能体只在单智能体触到上下文或专业边界时再拆。;4) Token、微调和压缩都要有对照数字,避免口号式优化。;5) 结论写成可检查清单:接口、超时、评测集、回滚版本。。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「问题从哪来」,本文给出了什么结论?
在「问题从哪来」部分,要点是:ofile Windows [ Environment ]:: SetEnvironmentVariable ( "HF_ENDPOINT" , "https://hf-mirror.com" , "User" ) 更多使用方式可参考 HF-Mirror 官方网站。 方法怎么选 curl -fsSL https://ollama.com/install.sh | sh Windows irm https : // ollama . co
关于「方法怎么选」,本文给出了什么结论?
在「方法怎么选」部分,要点是:载模型: 落地时先钉死的事 ollama pull qwen3.5:27b-nvfp4 ollama pull https://huggingface.co/lmstudio-community/Qwen3.5-27B-GGUF ollama 当前仅支持通过环境变量配置监听地址和端口,运行如下命令进行配置: echo "OLLAMA_HOST=0.0.0.0:11434" >> ~/.bash_profile Windows [ Env