<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Codex on 隔叶黄莺 Yanbin's Blog - 软件编程实践</title><link>https://yanbin.blog/tags/codex/</link><description>Recent content in Codex on 隔叶黄莺 Yanbin's Blog - 软件编程实践</description><generator>Hugo -- gohugo.io</generator><language>en-us</language><managingEditor>yabqiu@gmail.com (Yanbin Qiu)</managingEditor><webMaster>yabqiu@gmail.com (Yanbin Qiu)</webMaster><copyright>Yanbin 隔叶黄莺</copyright><lastBuildDate>Tue, 22 Sep 2026 20:20:20 -0500</lastBuildDate><atom:link href="https://yanbin.blog/tags/codex/index.xml" rel="self" type="application/rss+xml"/><item><title>配置编程 Agents 远程使用自部署的 Ollama 服务</title><link>https://yanbin.blog/ollama-with-remote-code-agents/</link><pubDate>Tue, 22 Sep 2026 20:20:20 -0500</pubDate><author>yabqiu@gmail.com (Yanbin Qiu)</author><guid>https://yanbin.blog/ollama-with-remote-code-agents/</guid><description>
&lt;p&gt;ChatGPT 免费版聊天都不够用, 而订阅了 ChatGPT Plus 虽说能用 Codex, 但别指望用它来真正做一个项目, 基本是实现还没开始就会要求禁闭五小时,
所以 ChatGPT Plus 也只能用当大排量的聊天机器人, 这方面比同价位的 Claude Pro 还不好, Claude Pro 勉强还能够稍稍推进一个编程项目.&lt;/p&gt;
&lt;p&gt;地下室有张两年以前买来玩游戏的 RTX 4090, 一直躺在那儿, 被 ChatGPT 要求静默五小时候不得不又考虑激活那张 4090, 在其上运行一个本地开源模型,
然后在别的机器上使用它. 订阅费是省了, 可是费电啊. 下面是关于 Ollama 及各编程 Agent 的配置, RTX 4090 运行在 Ubuntu Linux 操作系统中,
编程 Agent 是在 macOS 中运行的.&lt;/p&gt;
&lt;h3 id="1-工具及模型选择"&gt;1. 工具及模型选择&lt;/h3&gt;
&lt;p&gt;用 AI 调研了一下, 模型推理服务首推 Ollama, 它本身是 llama.cpp 的包装, 另有适合高性能并发的推理服务有 &lt;a href="https://www.sglang.io/"&gt;SGlang&lt;/a&gt;
和 &lt;a href="https://vllm.ai/"&gt;vLLM&lt;/a&gt;. 但 RTX 4090 也就那点能耐, 所以我们这里选用 Ollama.&lt;/p&gt;
&lt;p&gt;开放权重的大语言模型选择上看来还是阿里的千问较为突出, 相对于 RTX 4090 的 24G 显存, 可选择模型有以下&lt;/p&gt;</description></item></channel></rss>