Codex 本地模型 — 在本机运行 Ollama 与 GGUF 模型
运行在你本机上的模型可以和任何其他供应商一样出现在 Codex 模型选择器里。本页介绍 local-models 命令:该下载哪个模型、如何实测它真的能用、以及如何把本地模型当作纯文本供应商的视觉读取器。
启用本地模型
打开托盘的 Model Settings → Local LLMs,勾选想要的模型,然后完全退出并重新打开 Codex。CLI 等价命令:
./bin/control local-models list # 已安装,以及可以下载什么
./bin/control local-models install llama3.2:3b # 下载,带进度
./bin/control local-models set llama3.2:3b on # 发布到 Codex
./bin/control local-models uninstall llava --yes # 从磁盘删除
勾选、安装、移除是三个刻意分离的操作:取消勾选不会删除下载,移除需要显式确认。local 供应商在勾选第一个模型时自动开启,最后一个模型清除时自动关闭。
该下载哪个模型?
local-models list 会回答这个问题,而不是让你背标签。它把模型按用途分组,并显示大小与状态:
用于编码——实验性。Codex 的提示约占用 32K 窗口中的 20K:
llama3.2:3b 2.0 GB 已验证 真实跑通了 Codex 工具调用
qwen2.5-coder:1.5b 1.0 GB 未测试 最小的编码模型
devstral 14.3 GB 未测试 为代理而生
仅用于读图——不能编码:
qwen2.5vl:3b 3.2 GB 准确
moondream 1.7 GB 仅描述
实测模型真的能用
工具模板只是下限,不是保证。真正作数的是运行真实客户端:
./bin/control local-models agent-check llama3.2:3b
它在一个临时工作区里运行两次 codex exec,两次都必须验证一个只存在于那里的标记文件——证明模型派发了工具并读取了真实输出。两次都必须通过;结果不一致会报告为不稳定(flaky)。
对上下文窗口保持现实
每个本地模型都向 Codex 宣称 32K,而 Codex 自身的指令和工具定义在你加入代码之前就约占 20K——所以无论模型原生支持多少,实际可用约 12K。工具支持与原生上下文从模型自身文件读取(聊天模板与 GGUF 头,约 1MB 的分段请求),这正是 phi4 实际只有 16K、而非其家族暗示的 128K 的原因。
下载前先检查
./bin/control local-models inspect llama3.2:3b # tools:true context:131072
./bin/control local-models inspect phi4 # tools:false context:16384
同一次查询还携带下载大小和内存适配估算——Apple Silicon 读取统一内存、NVIDIA 报告 GPU 内存、其余用系统内存,并在上下文与缓存之上加约 20%:
fit | 含义 |
|---|---|
fits | 满速运行 |
tight | 能跑,但溢出到 CPU、较慢 |
too-large | 本机无法运行 |
install 会在下载任何内容之前拒绝 too-large 模型。tight 模型会警告并继续——那是个判断问题,不是硬墙。
Codex 需要工具调用
Codex 每一轮都通过工具调用来驱动,因此没有工具的模型会在第一个请求就失败。只有 Ollama 报告支持工具的模型才会发布到选择器;其余保持已安装、可继续当视觉读取器使用,标注为 “no tools — vision only”。
把本地模型当作视觉读取器
视觉桥默认开启:把截图粘贴给纯文本模型时,会先由支持视觉的模型读取,并以文本形式替换进回合,纯文本模型永远看不到图片。如果你所有供应商都是纯文本的,可以让桥指向你本机运行的视觉小模型——零成本、图片不离开电脑、可离线工作。
CLI 方式列出、拉取并固定一个:
./bin/control vision-bridge models
./bin/control vision-bridge pull qwen2.5vl:3b # 通过 Ollama 下载并固定
./bin/control vision-bridge local qwen2.5vl:3b # 固定本地读取器
桥本身不运行模型——它向任意 OpenAI 兼容的 /v1/chat/completions 端点 POST、无需凭据。Ollama、llama.cpp、LM Studio 都可以;vision-bridge probe 会检测常见运行时,并报告你的硬件建议(大致:8GB 以下 moondream、8GB qwen2.5vl:3b、16GB+ qwen2.5vl:7b)。
并非所有视觉模型都能”读”:大多数小模型会把场景描述得头头是道,然后编造代码和数字。选择器按实测而不是名声标注准确度——运行 node src/vision-benchmark.mjs 可对照一张已知发票图给每个已装模型打分。