
ChatGPT 免费版聊天都不够用, 而订阅了 ChatGPT Plus 虽说能用 Codex, 但别指望用它来真正做一个项目, 基本是实现还没开始就会要求禁闭五小时, 所以 ChatGPT Plus 也只能用当大排量的聊天机器人, 这方面比同价位的 Claude Pro 还不好, Claude Pro 勉强还能够稍稍推进一个编程项目.
地下室有张两年以前买来玩游戏的 RTX 4090, 一直躺在那儿, 被 ChatGPT 要求静默五小时候不得不又考虑激活那张 4090, 在其上运行一个本地开源模型, 然后在别的机器上使用它. 订阅费是省了, 可是费电啊. 下面是关于 Ollama 及各编程 Agent 的配置, RTX 4090 运行在 Ubuntu Linux 操作系统中, 编程 Agent 是在 macOS 中运行的.
1. 工具及模型选择
用 AI 调研了一下, 模型推理服务首推 Ollama, 它本身是 llama.cpp 的包装, 另有适合高性能并发的推理服务有 SGlang 和 vLLM. 但 RTX 4090 也就那点能耐, 所以我们这里选用 Ollama.
开放权重的大语言模型选择上看来还是阿里的千问较为突出, 相对于 RTX 4090 的 24G 显存, 可选择模型有以下
Read More