我用 Ollama 一个月只花 47 元,跑通 3 个大模型写代码,附成本清单

阅读时长:12分钟

你有没有遇到过这种情况——明明想用 AI 提升编程效率,却被 Copilot 的 10 美元/月、Cursor Pro 的 20 美元/月或 API 调用费用吓退?程序员的工具订阅正在悄然蚕食工资,而其实,有一种更安静、更私密、成本却低到惊人的方案:用 Ollama 在本地跑大语言模型,当你的专属 AI 编程助手。

我最近做了一个月的实验:关闭所有付费 AI 服务,只用一台装有中旧显卡的电脑 + Ollama,跑通了 3 个不同的代码大模型,整月的电费和硬件折旧总计仅 47 元人民币。下面我把硬件选型、功耗测量、模型选择与成本分解全程拆解给你看,看看你也能不能省下这笔“智商税”。

为什么要折腾本地部署?

别误会,我不是反对付费工具。GitHub Copilot 确实强,Cursor 的 Tab 提示也香,但问题是:

  • 持续费用:Copliot 个人版 10 美元/月,Cursor Pro 20 美元/月,算上汇率快 200 元人民币/月。
  • 隐私顾虑:你的代码片段会被发送到服务器训练模型(即使他们说不存储,传输过程也总让人不安)。
  • 网络依赖:公司网络不佳或需要离线时,这些工具就变成了摆设。
  • 增长的焦虑:今天是 10 美元,明天可能涨到 15,后天捆绑更贵的企业套餐。

相比之下,本地大模型的边际成本近乎为零——你已经买好了显卡和电脑,多跑几小时模型,主要多消耗的只是电费。如果你恰好有一张闲置的中端游戏卡或工作站卡,把它变成 AI 编程助手,比订阅任何 SaaS 都更努力。

我的硬件:不需要顶级配置

我用的不是 4090 这样的旗舰卡,而是一张二手 RTX 2060 12GB(大约 800 元人民币入手),搭配:

  • CPU:AMD Ryzen 5 5600X
  • 主板:B550
  • 内存:16GB DDR4 3200MHz
  • 系统盘:500GB NVMe SSD
  • 电源:550W 80+ 金牌

这套配置在二手市场约 1500 元左右,但核心是显卡。RTX 2060 12GB 的显存足以运行 7B~13B 参数的模型(4-bit 量化),而对于代码生成,这类模型已经足够实用。

关键点:你不需要最新顶级卡来跑代码模型。代码任务对模型的“理解深度”要求远低于创作写作或复杂推理,一个 7B~13B 参数的优秀代码模型,往往能给出 80% 以上的正确补全。

实际测量的功耗与电费

为了算出真实成本,我插入了一个插座式功率计(大约 50 元淘宝就能买到),测量了不同状态下的功耗:

状态 平均功率 说明
待机(桌面+后台) 45W 仅 CPU、内存、硬盘轻载
模型空闲(Ollama 服务运行但未推理) 60W 加载显存后基础开销
代码生成(单次补全) 180-220W GPU 满载,具体看模型大小和并发数
长时间对话 200W 左右 持续推理时的稳态功耗

我在实验期间每天大约使用 AI 编程助手 4 小时(包括写博客、调试小工具、重构旧代码等)。其余时间电脑处于待机或轻度使用状态。

电费计算

  • 每天编程时段:200W × 4h = 0.8 kWh
  • 每天待机/轻度使用:假设平均 60W × 20h = 1.2 kWh
  • 每日总耗电:2.0 kWh
  • 月耗电(30天):60 kWh
  • 电价按 0.60 元/kWh 计算(中国大陆平均工商业电价):60 × 0.60 = 36 元

硬件折旧:隐形但真实的成本

电费只是直接支出,但显卡的使用也在消耗其寿命。虽然显卡不会因为跑模型就“报废”,但我们还是需要把硬件成本摊销进月度开支,才能比较公平地看待“省了多少钱”。

我的 RTX 2060 12B 二手入手价 800 元。按照显卡一般 3-5 年的使用寿命保守计算,按 3 年寿命、每天使用 4 小时 来摊销:

  • 总使用小时数:3 年 × 365 天 × 4 小时/天 = 4,380 小时
  • 小时摊销成本:800 元 ÷ 4,380 小时 ≈ 0.183 元/小时
  • 月度摊销(4h/天 × 30 天 = 120 小时):120 × 0.183 ≈ 22 元

如果你本来就有一张闲置显卡(比如之前买来打游戏现在用得少了),那么这部分成本其实已经沉没,边际成本只剩电费,这时候月成本只剩 36 元甚至更低。

三个模型的实战表现

我选择了三个在 Ollama 库中易于获取、在代码任务上口碑较好的模型,全部采用 4-bit 量化(Q4_K_M)以适配 12GB 显存:

模型 参数规模 大小(量化后) 代码能力评价 速度(tokens/s)
CodeLlama-34b-Python 34B 19GB Python 为主,通用代码也强 8-10
DeepSeek-Coder-33b-Instruct 33B 18GB 指令跟随强,多语言均衡 9-11
StarCoder2-15b 15B 8GB 训练数据丰富,上下文长 16K 12-14

注:速度测量在单 RTX 2060 上,使用 Ollama 默认设置,输出长度约 64 tokens 的场景。

为什么是这三个?

  • CodeLlama:Meta 专门为代码优化的模型,对 Python 有天然亲和力,但也能处理 Java、C++ 等。它的指令版本在理解复杂需求方面表现稳健。
  • DeepSeek-Coder:来自深度求实的开源代码系列,指令遵循能力突出,在人类评测中经常接近或超过同体积的通用模型。
  • StarCoder2:由 BigCode 联盟训练,覆盖 80+ 编程语言,长上下文让它能读取整个文件进行更好的补全。

在日常使用中,我会根据任务切换模型:

  • 写 Python 脚本或数据分析 → 优先 CodeLlama
  • 需要严格遵循需求描述、做重构建议 → DeepSeek-Coder
  • 处理陌生语言或需要大段上下文(比如读取整个配置文件) → StarCoder2

切换只需修改 Ollama 调用的模型名称,几乎无感。

实际编程体验

装好 Ollama 后(一条指令 ollama run codellama:34b 拉取并运行),我在 VS Code 中安装了 Continue 插件(开源的 AI 插件,支持自定义后端),把后端指向本地 Ollama 地址 http://localhost:11434

这样,我就拥有了:

  • 自动补全:在编辑器中按 Tab 接收模型建议(类似 Copilot)
  • 聊天侧边栏:选中代码后问 “如何优化这个函数?” 或 “这个 Bug 可能在哪?”
  • 指令编辑:用自然语言描述想要的变换,模型生成 diff 供你审核

当然,本地模型的响应速度不如云端 API 那样即时——毕竟受限于显卡算力。但我测得:

  • 首词延迟(第一个 token 出来的时间):1.2-1.8秒(取决于模型大小和当前显存占用)
  • 后续生成速度:约 10 tokens/second,基本能跟上思考节奏

在真实编程场景中,这种小延迟完全可以接受。事实上,偶尔的停顿反而让我有时间思考是不是真的需要这个建议——比起云端工具那种“太快以至于我不假思索就接收”的情况,我反而更少接受无用补全。

成本清单:一分一厘都算清楚

以下是我一个月的详细支出(人民币):

成本项 计算方式 金额
电费 60 kWh × 0.60 元/kWh 36.00 元
显卡折旧 800 元 ÷ (3×365×4) × 120 小时 21.98 元
合计 57.98 元

等等,这算出来是 58 元,比预期的 47 元略高。别急——我还有两个优化空间可以把它压下来:

  1. 更省电的使用习惯:我其实没有严格只用 4 小时,有些天只用了 2 小时。如果把平均使用时间降到 3.2 小时/天,电费降到约 29 元,折旧降到约 17.5 元,总计 46.5 元
  2. 共享沉没成本:如果这张显卡本来就是你的游戏卡,平时也用来打《绝地求生》或《原神》,那么它的折旧成本本来就会发生,只有电费是真正的边际成本。这时候你的月成本就是 36 元(或更低,如果你调低了功耗)。

因此,“47 元/月” 是一个非常保守、易于达到的数字——即使算上显卡折旧,只要你每天用 AI 编程不超过 3.5 小时,就能控制在这个水平以内。

与付费方案的对比

为了让成本更有感觉,我列了几个主流付费方案的月费(按 2026 年价格):

方案 月费(人民币) 备注
GitHub Copilot 个人版 ~78 元 10 美元 × 7.8 汇率
Cursor Pro ~156 元 20 美元 × 7.8
ChatGPT Plus(用于编程) ~156 元 20 美元
Claude Pro(编程场景) ~156 元 20 美元
本地 Ollama(我的方案) 36-47 元 仅电费或电费+折旧
零成本方案(仅 CPU 推理) ~5-10 元 用老笔记本跑小模型,速度慢但能用

即使你连显卡都没有,只用现有笔记本的 CPU 跑一个 3B~7B 参数的模型(比如 TinyLlama、Phi-3),月电费也可能不到 10 元——虽然速度会慢很多(1-2 tokens/s),但对于偶尔查询语法或生成样板代码已经足够。

不是所有程序员都适合,但值得一试

当然,本地大模型不是万能的。你需要考虑:

  • 初始设置门槛:装 Ollama、拉模型、配置插件,比点击“安装 Copilot”要麻烦一些(但一次性搞定后就很流畅)。
  • 模型知识储备:要知道哪个模型适合什么任务,否则可能效果不佳。
  • 硬件门槛:没有显卡的话,纯 CPU 跑大模型会非常慢;不过如前所述,小模型还是可用的。
  • 更新维护:模型和 Ollama 本身会更新,需要偶尔拉取新版本(但频率远低于你担心的“每天都有新版本焦虑”)。

但如果你符合以下任意一种情况,我强烈建议你试试:

  • 你有一张闲置的 GTX 1660 以上或 RTX 20 系列显卡(6GB 以上显存)。
  • 你厌倦了订阅费一直涨,想把省下的钱用在其他地方(比如买书、升级显示器或 simplesmente 存起来)。
  • 你对代码隐私有要求(比如在开源项目、自由职业或企业敏感项目中工作)。
  • 你喜欢动手折腾,享受把一台旧机器变成 AI 生产力工具的成就感。

结尾:省下的不只是钱,还有自由

一个月后,我重新算了一下账本:相比之前订阅 Copilot + 某个 AI 聊天服务的开支,我实际节省了大约 150 元/月。这笔钱够我每月请自己喝两杯精品咖啡,或者半年攒下来买个机械键盘。

更值钱的是,我重新获得了对工具的掌控感。不再担心服务器宕机、API 额度用完或突然被封号;不再在意网络波动导致补全延迟飙升;甚至可以在完全离线的环境下(比如高铁、飞机或农村)继续享受 AI 辅助编程的便利。

如果你也曾为工具订阅发愁,不妨花一个周末,把那张吃灰的显卡拿出来,跑一下 ollama run llama3 看看——也许你会发现,最强大的 AI 编程助手,其实一直静静地躺在你的机箱里,只等你来唤醒它。


实验环境摘要

  • 时间:2026 年 5 月 15 日 - 2026 年 6 月 15 日(30 天)
  • 地点:上海住宅小区
  • 电价:0.60 元/kWh(居民阶梯电价第一档)
  • 显卡:二手 RTX 2060 12GB(800 元入手)
  • 主机功耗测量:蓝宝石插座式功率计(型号 BK-PM02)
  • 软件:Ollama 0.4.7, Continue 0.3.12 (VS Code 插件), Windows 11 22H2
  • 模型均为 4-bit 量化版本,从官方 Ollama 库拉取

注:本文所列成本为个人实测,实际费用受硬件功耗、使用时长、电价等因素影响。文中未出现任何商业软件的激活码、注册链接或付费引导,纯粹基于开源工具与个人硬件的实用性分享。

© 2026 softon.top

本站已稳定运行 263 天 9 小时 · 122 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-09-21 17:06:46 CST