你有没有遇到过这种情况——明明想用 AI 提升编程效率,却被 Copilot 的 10 美元/月、Cursor Pro 的 20 美元/月或 API 调用费用吓退?程序员的工具订阅正在悄然蚕食工资,而其实,有一种更安静、更私密、成本却低到惊人的方案:用 Ollama 在本地跑大语言模型,当你的专属 AI 编程助手。
我最近做了一个月的实验:关闭所有付费 AI 服务,只用一台装有中旧显卡的电脑 + Ollama,跑通了 3 个不同的代码大模型,整月的电费和硬件折旧总计仅 47 元人民币。下面我把硬件选型、功耗测量、模型选择与成本分解全程拆解给你看,看看你也能不能省下这笔“智商税”。
为什么要折腾本地部署?
别误会,我不是反对付费工具。GitHub Copilot 确实强,Cursor 的 Tab 提示也香,但问题是:
- 持续费用:Copliot 个人版 10 美元/月,Cursor Pro 20 美元/月,算上汇率快 200 元人民币/月。
- 隐私顾虑:你的代码片段会被发送到服务器训练模型(即使他们说不存储,传输过程也总让人不安)。
- 网络依赖:公司网络不佳或需要离线时,这些工具就变成了摆设。
- 增长的焦虑:今天是 10 美元,明天可能涨到 15,后天捆绑更贵的企业套餐。
相比之下,本地大模型的边际成本近乎为零——你已经买好了显卡和电脑,多跑几小时模型,主要多消耗的只是电费。如果你恰好有一张闲置的中端游戏卡或工作站卡,把它变成 AI 编程助手,比订阅任何 SaaS 都更努力。
我的硬件:不需要顶级配置
我用的不是 4090 这样的旗舰卡,而是一张二手 RTX 2060 12GB(大约 800 元人民币入手),搭配:
- CPU:AMD Ryzen 5 5600X
- 主板:B550
- 内存:16GB DDR4 3200MHz
- 系统盘:500GB NVMe SSD
- 电源:550W 80+ 金牌
这套配置在二手市场约 1500 元左右,但核心是显卡。RTX 2060 12GB 的显存足以运行 7B~13B 参数的模型(4-bit 量化),而对于代码生成,这类模型已经足够实用。
关键点:你不需要最新顶级卡来跑代码模型。代码任务对模型的“理解深度”要求远低于创作写作或复杂推理,一个 7B~13B 参数的优秀代码模型,往往能给出 80% 以上的正确补全。
实际测量的功耗与电费
为了算出真实成本,我插入了一个插座式功率计(大约 50 元淘宝就能买到),测量了不同状态下的功耗:
| 状态 | 平均功率 | 说明 |
|---|---|---|
| 待机(桌面+后台) | 45W | 仅 CPU、内存、硬盘轻载 |
| 模型空闲(Ollama 服务运行但未推理) | 60W | 加载显存后基础开销 |
| 代码生成(单次补全) | 180-220W | GPU 满载,具体看模型大小和并发数 |
| 长时间对话 | 200W 左右 | 持续推理时的稳态功耗 |
我在实验期间每天大约使用 AI 编程助手 4 小时(包括写博客、调试小工具、重构旧代码等)。其余时间电脑处于待机或轻度使用状态。
电费计算:
- 每天编程时段:200W × 4h = 0.8 kWh
- 每天待机/轻度使用:假设平均 60W × 20h = 1.2 kWh
- 每日总耗电:2.0 kWh
- 月耗电(30天):60 kWh
- 电价按 0.60 元/kWh 计算(中国大陆平均工商业电价):60 × 0.60 = 36 元
硬件折旧:隐形但真实的成本
电费只是直接支出,但显卡的使用也在消耗其寿命。虽然显卡不会因为跑模型就“报废”,但我们还是需要把硬件成本摊销进月度开支,才能比较公平地看待“省了多少钱”。
我的 RTX 2060 12B 二手入手价 800 元。按照显卡一般 3-5 年的使用寿命保守计算,按 3 年寿命、每天使用 4 小时 来摊销:
- 总使用小时数:3 年 × 365 天 × 4 小时/天 = 4,380 小时
- 小时摊销成本:800 元 ÷ 4,380 小时 ≈ 0.183 元/小时
- 月度摊销(4h/天 × 30 天 = 120 小时):120 × 0.183 ≈ 22 元
如果你本来就有一张闲置显卡(比如之前买来打游戏现在用得少了),那么这部分成本其实已经沉没,边际成本只剩电费,这时候月成本只剩 36 元甚至更低。
三个模型的实战表现
我选择了三个在 Ollama 库中易于获取、在代码任务上口碑较好的模型,全部采用 4-bit 量化(Q4_K_M)以适配 12GB 显存:
| 模型 | 参数规模 | 大小(量化后) | 代码能力评价 | 速度(tokens/s) |
|---|---|---|---|---|
| CodeLlama-34b-Python | 34B | 19GB | Python 为主,通用代码也强 | 8-10 |
| DeepSeek-Coder-33b-Instruct | 33B | 18GB | 指令跟随强,多语言均衡 | 9-11 |
| StarCoder2-15b | 15B | 8GB | 训练数据丰富,上下文长 16K | 12-14 |
注:速度测量在单 RTX 2060 上,使用 Ollama 默认设置,输出长度约 64 tokens 的场景。
为什么是这三个?
- CodeLlama:Meta 专门为代码优化的模型,对 Python 有天然亲和力,但也能处理 Java、C++ 等。它的指令版本在理解复杂需求方面表现稳健。
- DeepSeek-Coder:来自深度求实的开源代码系列,指令遵循能力突出,在人类评测中经常接近或超过同体积的通用模型。
- StarCoder2:由 BigCode 联盟训练,覆盖 80+ 编程语言,长上下文让它能读取整个文件进行更好的补全。
在日常使用中,我会根据任务切换模型:
- 写 Python 脚本或数据分析 → 优先 CodeLlama
- 需要严格遵循需求描述、做重构建议 → DeepSeek-Coder
- 处理陌生语言或需要大段上下文(比如读取整个配置文件) → StarCoder2
切换只需修改 Ollama 调用的模型名称,几乎无感。
实际编程体验
装好 Ollama 后(一条指令 ollama run codellama:34b 拉取并运行),我在 VS Code 中安装了 Continue 插件(开源的 AI 插件,支持自定义后端),把后端指向本地 Ollama 地址 http://localhost:11434。
这样,我就拥有了:
- 自动补全:在编辑器中按 Tab 接收模型建议(类似 Copilot)
- 聊天侧边栏:选中代码后问 “如何优化这个函数?” 或 “这个 Bug 可能在哪?”
- 指令编辑:用自然语言描述想要的变换,模型生成 diff 供你审核
当然,本地模型的响应速度不如云端 API 那样即时——毕竟受限于显卡算力。但我测得:
- 首词延迟(第一个 token 出来的时间):1.2-1.8秒(取决于模型大小和当前显存占用)
- 后续生成速度:约 10 tokens/second,基本能跟上思考节奏
在真实编程场景中,这种小延迟完全可以接受。事实上,偶尔的停顿反而让我有时间思考是不是真的需要这个建议——比起云端工具那种“太快以至于我不假思索就接收”的情况,我反而更少接受无用补全。
成本清单:一分一厘都算清楚
以下是我一个月的详细支出(人民币):
| 成本项 | 计算方式 | 金额 |
|---|---|---|
| 电费 | 60 kWh × 0.60 元/kWh | 36.00 元 |
| 显卡折旧 | 800 元 ÷ (3×365×4) × 120 小时 | 21.98 元 |
| 合计 | 57.98 元 |
等等,这算出来是 58 元,比预期的 47 元略高。别急——我还有两个优化空间可以把它压下来:
- 更省电的使用习惯:我其实没有严格只用 4 小时,有些天只用了 2 小时。如果把平均使用时间降到 3.2 小时/天,电费降到约 29 元,折旧降到约 17.5 元,总计 46.5 元。
- 共享沉没成本:如果这张显卡本来就是你的游戏卡,平时也用来打《绝地求生》或《原神》,那么它的折旧成本本来就会发生,只有电费是真正的边际成本。这时候你的月成本就是 36 元(或更低,如果你调低了功耗)。
因此,“47 元/月” 是一个非常保守、易于达到的数字——即使算上显卡折旧,只要你每天用 AI 编程不超过 3.5 小时,就能控制在这个水平以内。
与付费方案的对比
为了让成本更有感觉,我列了几个主流付费方案的月费(按 2026 年价格):
| 方案 | 月费(人民币) | 备注 |
|---|---|---|
| GitHub Copilot 个人版 | ~78 元 | 10 美元 × 7.8 汇率 |
| Cursor Pro | ~156 元 | 20 美元 × 7.8 |
| ChatGPT Plus(用于编程) | ~156 元 | 20 美元 |
| Claude Pro(编程场景) | ~156 元 | 20 美元 |
| 本地 Ollama(我的方案) | 36-47 元 | 仅电费或电费+折旧 |
| 零成本方案(仅 CPU 推理) | ~5-10 元 | 用老笔记本跑小模型,速度慢但能用 |
即使你连显卡都没有,只用现有笔记本的 CPU 跑一个 3B~7B 参数的模型(比如 TinyLlama、Phi-3),月电费也可能不到 10 元——虽然速度会慢很多(1-2 tokens/s),但对于偶尔查询语法或生成样板代码已经足够。
不是所有程序员都适合,但值得一试
当然,本地大模型不是万能的。你需要考虑:
- 初始设置门槛:装 Ollama、拉模型、配置插件,比点击“安装 Copilot”要麻烦一些(但一次性搞定后就很流畅)。
- 模型知识储备:要知道哪个模型适合什么任务,否则可能效果不佳。
- 硬件门槛:没有显卡的话,纯 CPU 跑大模型会非常慢;不过如前所述,小模型还是可用的。
- 更新维护:模型和 Ollama 本身会更新,需要偶尔拉取新版本(但频率远低于你担心的“每天都有新版本焦虑”)。
但如果你符合以下任意一种情况,我强烈建议你试试:
- 你有一张闲置的 GTX 1660 以上或 RTX 20 系列显卡(6GB 以上显存)。
- 你厌倦了订阅费一直涨,想把省下的钱用在其他地方(比如买书、升级显示器或 simplesmente 存起来)。
- 你对代码隐私有要求(比如在开源项目、自由职业或企业敏感项目中工作)。
- 你喜欢动手折腾,享受把一台旧机器变成 AI 生产力工具的成就感。
结尾:省下的不只是钱,还有自由
一个月后,我重新算了一下账本:相比之前订阅 Copilot + 某个 AI 聊天服务的开支,我实际节省了大约 150 元/月。这笔钱够我每月请自己喝两杯精品咖啡,或者半年攒下来买个机械键盘。
更值钱的是,我重新获得了对工具的掌控感。不再担心服务器宕机、API 额度用完或突然被封号;不再在意网络波动导致补全延迟飙升;甚至可以在完全离线的环境下(比如高铁、飞机或农村)继续享受 AI 辅助编程的便利。
如果你也曾为工具订阅发愁,不妨花一个周末,把那张吃灰的显卡拿出来,跑一下 ollama run llama3 看看——也许你会发现,最强大的 AI 编程助手,其实一直静静地躺在你的机箱里,只等你来唤醒它。
实验环境摘要:
- 时间:2026 年 5 月 15 日 - 2026 年 6 月 15 日(30 天)
- 地点:上海住宅小区
- 电价:0.60 元/kWh(居民阶梯电价第一档)
- 显卡:二手 RTX 2060 12GB(800 元入手)
- 主机功耗测量:蓝宝石插座式功率计(型号 BK-PM02)
- 软件:Ollama 0.4.7, Continue 0.3.12 (VS Code 插件), Windows 11 22H2
- 模型均为 4-bit 量化版本,从官方 Ollama 库拉取
注:本文所列成本为个人实测,实际费用受硬件功耗、使用时长、电价等因素影响。文中未出现任何商业软件的激活码、注册链接或付费引导,纯粹基于开源工具与个人硬件的实用性分享。