云端 API 三年 vs 本地自托管:Otis 这类极简本地 Agent 到底省不省钱(人民币口径实算)

阅读时长:9分钟

前阵子 Show HN 上一个叫 Otis 的开源项目很对我的胃口:一个极简 AI Agent,安装时根据你的硬件自动推荐本地模型、自动下载、直接跑起来,还能接 Ollama、LM Studio、Nvidia PAIR。官方口径是"隐私优先、开箱即用"。

听着很美。但"开箱即用"四个字背后藏着一笔账:你的电费、显卡折旧、模型维护、没 SLA 的风险,全算你自己头上

所以我决定不动手装,先把账算完。本文用人民币口径,把本地自托管和云端 API 两条路三年的总成本拆开对一遍,看看"本地=省钱"这个直觉到底站不站得住。

TL;DR

  • 个人消费级(RTX 4090)本地月成本约 ¥749,只有日均 token 量超过 200-300 万才可能比 OpenAI 系 API 便宜
  • 托管开源 API(DeepInfra/Groq/Together 这一档)约 ¥0.65-0.79/百万 token,是个人本地自托管之前的正确中间站
  • 企业级自托管(2×A100)月成本约 ¥8700,三年 ¥31 万+,盈亏点推到日均 1500-2000 万 token,个人根本碰不到
  • 本地部署的真实成本 = 硬件摊销 + 电费 + 维护 + 无 SLA,隐藏成本吃硬件摊销的 20%-40%,很多人第一年会算错
  • Otis 这类工具的价值不在省钱,在于把本地 Agent 的启动门槛从"折腾一周"压到"点一下安装",适不适合你取决于你的 token 量和隐私需求

为什么"本地=省钱"是错觉?

先摆一个最反直觉的事实:本地 LLM 的标价是 0 元/百万 token,但这不是 0 成本,是成本被摊到你自己的硬件和电费里了

云端 API 的商业模式是:你按 token 付钱,我负责 GPU、冷却、运维、SLA。你付的钱里已经包含了这些成本,还带了利润。

本地部署是反过来:GPU 你买,电费你交,宕机你修,模型升级你测。单价看似为零,实际上每个 token 都在从你的显卡寿命和电表上"扣钱"。

所以真正的比较不是"0 vs 0.7 元/百万",而是:三年里,我的 token 总量 × 云端单价,和我(硬件折旧 + 电费 + 维护时间)的总和,哪个大

Otis 是什么?先对齐讨论对象

写账本之前先说清楚我查到的 Otis 事实(来源:Hacker News 帖 49696084 + Reddit r/LocalLLM 开发者原帖,2026-09 前后发布):

项目 事实
定位 极简本地 + 托管开源模型 Agent,隐私优先设计
安装行为 按本机硬件推荐模型,自动下载,默认走 llama.cpp 推理
兼容运行时 Ollama、LM Studio、Nvidia PAIR
作者自述门槛 本地模型建议 24GB+ 内存(RAM/显存)体验才舒服
模型建议 24GB 档配 Qwen 系 27B 左右;轻任务可降级 Gemma 系

我特别在意"自动推荐 + 自动下载"这一点:它解决的是本地部署里最劝退的环节——你根本不知道该装哪个模型。但注意,它解决的是启动门槛,不解决成本问题。你点完安装,电表就开始走了。

人民币成本账:三条路线的完整口径

以下数字基于 2026 年中的公开成本分析(SitePoint 2026 TCO 报告、vensas.de 自托管成本测算、Groq/DeepInfra 托管价),汇率按 1 USD ≈ 7.2 元、1 EUR ≈ 7.8 元,国内民用电按 0.5 元/kWh 口径。

路线一:个人消费级本地(RTX 4090 档)

成本项 月成本(约) 说明
硬件摊销 ¥550 整机 ¥3.3 万档(4090 + 平台),按 24-36 个月摊
电费 ¥80-150 1.5kW × 7×24 小时 × 0.5 元/kWh 量级,视利用率
模型管理/维护 ¥50-100 拉新模型、测兼容性、修问题的时间折算
月合计 ≈ ¥749 即"约 100 美元/月"的中国口径
三年合计 ≈ ¥2.2 万 未计时间成本

关键:这套跑 7B-14B 量化模型完全够用,27B 就要看脸(内存带宽)。Otis 作者那句"24GB+ 才舒服"翻译过来就是:16GB 的 4090 能跑,但上下文一长就喘。

路线二:云端 API(按 token 付)

档位 价格(人民币口径) 三年 300 万 token/天的成本(约)
旗舰 API(OpenAI/Anthropic 混用) ¥2.5-6/百万 token ¥270 万-650 万
开源托管 API(DeepInfra/Groq/Together) ¥0.65-0.79/百万 token ¥70 万-87 万
国产主力 API(DeepSeek 系走量) ¥0.1-0.3/百万 token ¥11 万-33 万

旗舰档我单列只为说明:只有高价值任务才值得花钱用旗舰,日常 Agent 跑量用中间档或国产走量档。

路线三:企业级自托管(2×A100 档,供对照)

月成本约 ¥8700(硬件摊销 ¥4000 + 电力制冷 ¥1800 + 运维 ¥1500 + 场地杂项 ¥4000 量级),三年约 ¥31 万。它的盈亏平衡点在日均 1500-2000 万 token,这是稳定高 GPU 利用率才能达到的区间,个人和小团队基本碰不到。

盈亏平衡点到底在哪?

把三条线放一起算,结论很硬:

  • 个人 4090 本地 vs 旗舰 API:日均 200-300 万 token 之上,本地才开始便宜。绝大多数个人开发者日均 token 量在这个数字的 1/10 以下,本地第一年几乎一定不划算
  • 本地 vs 开源托管 API:要推到日均 1500-2000 万 token 才打平。也就是说,托管开源 API 才是本地自托管之前的正确姿势——¥0.7/百万 token,你连电费都不用付,SLA 还有人管。
  • 本地 vs 国产走量 API:这个比值最好看,国产 API 单价已经压到 ¥0.1-0.3/百万,本地部署的盈亏点被推到更高处。“本地=省钱"在国内电价 + 国产 API 双重挤压下,个人场景基本不成立

本地部署真正成立的场景就三类:数据不出网(合规/隐私硬需求)、日均量真的大过盈亏点、或者你就是想玩(那就不叫成本,叫爱好)。

隐藏成本清单:你一定会漏的四笔

对照上面所有测算,再乘一个系数——隐藏成本约吃掉硬件摊销的 20%-40%

  1. 电费波动:模型跑满和待机差一个数量级,散热差的房间夏天电费翻倍
  2. 模型迭代税:开源模型 6-8 周一个版本,每个版本你要重新测、重新量化、重新配 Agent
  3. 宕机无 SLA:云端挂了有人赔,本地挂了你自己查显存温度
  4. 上下文成本:Agent 场景 token 量随工具调用暴涨,本地跑 Agent 的 token 消耗是聊天的 5-10 倍,盈亏点要按 Agent 实际量算

那 Otis 这类工具还有什么价值?

诚实说:它不解决"本地更贵"这个事实,它解决的是"本地更难启动"这个事实

价值点 说明
门槛压缩 从"选模型+装运行时+调格式一周"压到"点安装”
统一体验 本地/托管开源模型一个入口,切模型不用换 Agent
隐私硬需求 敏感数据不出网时,成本是溢价不是障碍
成本透明化 它推荐了模型,就该让你看到"你选了 27B 还是 14B,电表会怎么走"

我的判断:Otis 的正确用户画像是有明确隐私需求、或者 token 量过盈亏点的团队,而不是"想省 API 钱的个人"。

常见问题

Q1: 个人跑本地 Agent 到底每月花多少?

A: 4090 档约 ¥749/月(硬件摊销 + 电费 + 维护),36 个月约 ¥2.2 万。24GB 显存/内存以下体验会打折。

Q2: 本地 LLM 0 元/百万 token 是不是真省钱?

A: 不是。成本转移到硬件折旧和电费。个人日均 token 量低于 200-300 万时,本地第一年基本打不过云端 API。

Q3: 什么情况下本地部署才划算?

A: 三类:数据合规要求不出网;日均稳定过盈亏点(4090 档约 200-300 万 token/天);自托管企业级(双 A100)要到 1500-2000 万 token/天。

Q4: 开源托管 API 是什么,和自托管什么关系?

A: DeepInfra/Groq/Together 这一档,约 ¥0.65-0.79/百万 token,免运维有 SLA。是"上自托管之前"的中间站,量没那么大就先用它。

Q5: Otis 和 LM Studio/Ollama 什么区别?

A: Ollama/LM Studio 是模型运行时,Otis 是 Agent 层——它按你的硬件推荐并下载模型,默认走 llama.cpp,也支持 Ollama/LM Studio/Nvidia PAIR。

Q6: 电费按什么口径算合理?

A: 国内 0.5 元/kWh(民用电 0.4-0.6 区间)。1.5kW 持续满载 7 小时/天约 ¥50/月;满载 24 小时约 ¥150/月。

Q7: 国产 API(如 DeepSeek 走量档)会不会让本地更没戏?

A: 会。¥0.1-0.3/百万 token 的单价把本地盈亏点又推高一截。本地部署的主张应从"省钱"改口为"隐私 + 可控 + 断网可用"。

相关阅读

© 2026 softon.top

本站已稳定运行 263 天 9 小时 · 122 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-09-21 17:06:46 CST