前阵子 Show HN 上一个叫 Otis 的开源项目很对我的胃口:一个极简 AI Agent,安装时根据你的硬件自动推荐本地模型、自动下载、直接跑起来,还能接 Ollama、LM Studio、Nvidia PAIR。官方口径是"隐私优先、开箱即用"。
听着很美。但"开箱即用"四个字背后藏着一笔账:你的电费、显卡折旧、模型维护、没 SLA 的风险,全算你自己头上。
所以我决定不动手装,先把账算完。本文用人民币口径,把本地自托管和云端 API 两条路三年的总成本拆开对一遍,看看"本地=省钱"这个直觉到底站不站得住。
TL;DR
- 个人消费级(RTX 4090)本地月成本约 ¥749,只有日均 token 量超过 200-300 万才可能比 OpenAI 系 API 便宜
- 托管开源 API(DeepInfra/Groq/Together 这一档)约 ¥0.65-0.79/百万 token,是个人本地自托管之前的正确中间站
- 企业级自托管(2×A100)月成本约 ¥8700,三年 ¥31 万+,盈亏点推到日均 1500-2000 万 token,个人根本碰不到
- 本地部署的真实成本 = 硬件摊销 + 电费 + 维护 + 无 SLA,隐藏成本吃硬件摊销的 20%-40%,很多人第一年会算错
- Otis 这类工具的价值不在省钱,在于把本地 Agent 的启动门槛从"折腾一周"压到"点一下安装",适不适合你取决于你的 token 量和隐私需求
为什么"本地=省钱"是错觉?
先摆一个最反直觉的事实:本地 LLM 的标价是 0 元/百万 token,但这不是 0 成本,是成本被摊到你自己的硬件和电费里了。
云端 API 的商业模式是:你按 token 付钱,我负责 GPU、冷却、运维、SLA。你付的钱里已经包含了这些成本,还带了利润。
本地部署是反过来:GPU 你买,电费你交,宕机你修,模型升级你测。单价看似为零,实际上每个 token 都在从你的显卡寿命和电表上"扣钱"。
所以真正的比较不是"0 vs 0.7 元/百万",而是:三年里,我的 token 总量 × 云端单价,和我(硬件折旧 + 电费 + 维护时间)的总和,哪个大。
Otis 是什么?先对齐讨论对象
写账本之前先说清楚我查到的 Otis 事实(来源:Hacker News 帖 49696084 + Reddit r/LocalLLM 开发者原帖,2026-09 前后发布):
| 项目 | 事实 |
|---|---|
| 定位 | 极简本地 + 托管开源模型 Agent,隐私优先设计 |
| 安装行为 | 按本机硬件推荐模型,自动下载,默认走 llama.cpp 推理 |
| 兼容运行时 | Ollama、LM Studio、Nvidia PAIR |
| 作者自述门槛 | 本地模型建议 24GB+ 内存(RAM/显存)体验才舒服 |
| 模型建议 | 24GB 档配 Qwen 系 27B 左右;轻任务可降级 Gemma 系 |
我特别在意"自动推荐 + 自动下载"这一点:它解决的是本地部署里最劝退的环节——你根本不知道该装哪个模型。但注意,它解决的是启动门槛,不解决成本问题。你点完安装,电表就开始走了。
人民币成本账:三条路线的完整口径
以下数字基于 2026 年中的公开成本分析(SitePoint 2026 TCO 报告、vensas.de 自托管成本测算、Groq/DeepInfra 托管价),汇率按 1 USD ≈ 7.2 元、1 EUR ≈ 7.8 元,国内民用电按 0.5 元/kWh 口径。
路线一:个人消费级本地(RTX 4090 档)
| 成本项 | 月成本(约) | 说明 |
|---|---|---|
| 硬件摊销 | ¥550 | 整机 ¥3.3 万档(4090 + 平台),按 24-36 个月摊 |
| 电费 | ¥80-150 | 1.5kW × 7×24 小时 × 0.5 元/kWh 量级,视利用率 |
| 模型管理/维护 | ¥50-100 | 拉新模型、测兼容性、修问题的时间折算 |
| 月合计 | ≈ ¥749 | 即"约 100 美元/月"的中国口径 |
| 三年合计 | ≈ ¥2.2 万 | 未计时间成本 |
关键:这套跑 7B-14B 量化模型完全够用,27B 就要看脸(内存带宽)。Otis 作者那句"24GB+ 才舒服"翻译过来就是:16GB 的 4090 能跑,但上下文一长就喘。
路线二:云端 API(按 token 付)
| 档位 | 价格(人民币口径) | 三年 300 万 token/天的成本(约) |
|---|---|---|
| 旗舰 API(OpenAI/Anthropic 混用) | ¥2.5-6/百万 token | ¥270 万-650 万 |
| 开源托管 API(DeepInfra/Groq/Together) | ¥0.65-0.79/百万 token | ¥70 万-87 万 |
| 国产主力 API(DeepSeek 系走量) | ¥0.1-0.3/百万 token | ¥11 万-33 万 |
旗舰档我单列只为说明:只有高价值任务才值得花钱用旗舰,日常 Agent 跑量用中间档或国产走量档。
路线三:企业级自托管(2×A100 档,供对照)
月成本约 ¥8700(硬件摊销 ¥4000 + 电力制冷 ¥1800 + 运维 ¥1500 + 场地杂项 ¥4000 量级),三年约 ¥31 万。它的盈亏平衡点在日均 1500-2000 万 token,这是稳定高 GPU 利用率才能达到的区间,个人和小团队基本碰不到。
盈亏平衡点到底在哪?
把三条线放一起算,结论很硬:
- 个人 4090 本地 vs 旗舰 API:日均 200-300 万 token 之上,本地才开始便宜。绝大多数个人开发者日均 token 量在这个数字的 1/10 以下,本地第一年几乎一定不划算。
- 本地 vs 开源托管 API:要推到日均 1500-2000 万 token 才打平。也就是说,托管开源 API 才是本地自托管之前的正确姿势——¥0.7/百万 token,你连电费都不用付,SLA 还有人管。
- 本地 vs 国产走量 API:这个比值最好看,国产 API 单价已经压到 ¥0.1-0.3/百万,本地部署的盈亏点被推到更高处。“本地=省钱"在国内电价 + 国产 API 双重挤压下,个人场景基本不成立。
本地部署真正成立的场景就三类:数据不出网(合规/隐私硬需求)、日均量真的大过盈亏点、或者你就是想玩(那就不叫成本,叫爱好)。
隐藏成本清单:你一定会漏的四笔
对照上面所有测算,再乘一个系数——隐藏成本约吃掉硬件摊销的 20%-40%:
- 电费波动:模型跑满和待机差一个数量级,散热差的房间夏天电费翻倍
- 模型迭代税:开源模型 6-8 周一个版本,每个版本你要重新测、重新量化、重新配 Agent
- 宕机无 SLA:云端挂了有人赔,本地挂了你自己查显存温度
- 上下文成本:Agent 场景 token 量随工具调用暴涨,本地跑 Agent 的 token 消耗是聊天的 5-10 倍,盈亏点要按 Agent 实际量算
那 Otis 这类工具还有什么价值?
诚实说:它不解决"本地更贵"这个事实,它解决的是"本地更难启动"这个事实。
| 价值点 | 说明 |
|---|---|
| 门槛压缩 | 从"选模型+装运行时+调格式一周"压到"点安装” |
| 统一体验 | 本地/托管开源模型一个入口,切模型不用换 Agent |
| 隐私硬需求 | 敏感数据不出网时,成本是溢价不是障碍 |
| 成本透明化 | 它推荐了模型,就该让你看到"你选了 27B 还是 14B,电表会怎么走" |
我的判断:Otis 的正确用户画像是有明确隐私需求、或者 token 量过盈亏点的团队,而不是"想省 API 钱的个人"。
常见问题
Q1: 个人跑本地 Agent 到底每月花多少?
A: 4090 档约 ¥749/月(硬件摊销 + 电费 + 维护),36 个月约 ¥2.2 万。24GB 显存/内存以下体验会打折。
Q2: 本地 LLM 0 元/百万 token 是不是真省钱?
A: 不是。成本转移到硬件折旧和电费。个人日均 token 量低于 200-300 万时,本地第一年基本打不过云端 API。
Q3: 什么情况下本地部署才划算?
A: 三类:数据合规要求不出网;日均稳定过盈亏点(4090 档约 200-300 万 token/天);自托管企业级(双 A100)要到 1500-2000 万 token/天。
Q4: 开源托管 API 是什么,和自托管什么关系?
A: DeepInfra/Groq/Together 这一档,约 ¥0.65-0.79/百万 token,免运维有 SLA。是"上自托管之前"的中间站,量没那么大就先用它。
Q5: Otis 和 LM Studio/Ollama 什么区别?
A: Ollama/LM Studio 是模型运行时,Otis 是 Agent 层——它按你的硬件推荐并下载模型,默认走 llama.cpp,也支持 Ollama/LM Studio/Nvidia PAIR。
Q6: 电费按什么口径算合理?
A: 国内 0.5 元/kWh(民用电 0.4-0.6 区间)。1.5kW 持续满载 7 小时/天约 ¥50/月;满载 24 小时约 ¥150/月。
Q7: 国产 API(如 DeepSeek 走量档)会不会让本地更没戏?
A: 会。¥0.1-0.3/百万 token 的单价把本地盈亏点又推高一截。本地部署的主张应从"省钱"改口为"隐私 + 可控 + 断网可用"。