Claude Cowork、ChatGPT Team、Cursor Business,一个月 20 美元起,谁付得起?付得起的又一半不敢往里贴东西——治疗师的会谈记录、老师批的学生作业、律师起草的动议,一句“数据可能被用来改进模型”就够让人手抖。
Sageling 昨天在 Hacker News 上冒出来(Show HN,2 points,冷启动),瞄的就是这块夹在“付不起”和“不敢用”中间的空白:Mac 端本地 AI 助手,MLX in-process 跑 Qwen 3.5 9B,模型直接嵌进 app,一句网络都不打。
我看了官网和 HN 帖子,结合我用 Ollama、LM Studio、Claude Code 那一堆家伙的经验,觉得这条路子跟站上以前写过的本地 AI 都不太一样。今天就拆一拆。
TL;DR
- Sageling 面向非开发者,MLX in-process 跑 Qwen 3.5 9B,8 GB 模型首次下载后完全离线可用
- 走的不是 Ollama / LM Studio 那套“本地 API + 前端调”的路子,模型直接编进 app,砍掉一层 localhost 服务
- 硬件门槛:Apple Silicon Mac + ≥16 GB 统一内存 + macOS 13 及以上
- 目标场景:治疗师病历、老师批作业、律师文书、包含敏感信息的日常工作
- 免费下载,不上传对话文件,记忆以纯文本存本地磁盘,可读可编辑可删
为什么非开发者用不起,也用不敢云 AI?
我朋友里那批不写代码的——一个做心理治疗,一个大学助教改考卷,还有个做劳动仲裁——她们对 AI 的印象基本停留在“能不能帮我写个邮件”。
问她们为什么不上 Claude Cowork、ChatGPT Plus,答案高度一致:
- 贵:20 美元一个月,用两次就觉得亏;上限一到就催升级到 200 美元
- 心里没底:一份治疗记录、一份学生成绩单、一份合同草稿,谁敢往云端灌?平台隐私声明写得再漂亮,训练用不用、员工能不能看、数据存哪个国家,这些普通人根本弄不清
Sageling 的作者在 HN 上把这两个痛点讲得直白(Show HN 原帖):
- Well, I don’t wanna pay a bunch of money for it, and the $20 plans run out real fast.
- I’m dealing with sensitive info (student grades, therapy notes, legal work, etc) and I don’t wanna give it to anyone.
这两句话套在中国用户身上一样成立。你把 API key 塞给 Cursor 就等于把项目源码交给模型商,把公司报表贴给 ChatGPT 就等于把财务数据搬出内网,把病人档案传给云端就是直接违规。
本地 AI 不是新东西,Ollama、LM Studio 都能跑。但那些是给会写代码的人玩的——你得懂什么叫“模型下载”“量化版本”“API 端口”“system prompt”。让一个心理治疗师去装 Ollama、拉模型、写 prompt,是一次劝退。
Sageling 想解决的就是这个“最后一米”:把 MLX 引擎、模型、agent 框架、UI 全打包成一个 dmg,双击安装,跟装 Notion 一样。
Sageling 到底跟 Ollama、LM Studio 差在哪?
这是我最想拆的点。表面上看都是“Mac 本地跑开源模型”,架构差别其实很大。
| 维度 | Ollama | LM Studio | Sageling |
|---|---|---|---|
| 引擎 | llama.cpp(可选 MLX 预览) | llama.cpp / MLX 二选一 | MLX(in-process) |
| 模型交付方式 | CLI 拉,本地服务化 | GUI 拉,本地服务化 | 首次启动下载 ~8 GB,直接嵌进 app |
| 对外接口 | OpenAI 兼容 API @ 11434 | OpenAI 兼容 API 可选 | 无(in-process 调用,不开端口) |
| 目标用户 | 开发者 | 半技术玩家 | 完全的非开发者 |
| Agent 能力 | 没有(要自己拼 harness) | 没有(自己接 client) | 内置 harness + skills,直接用 |
| 隐私边界 | 本地进程,但监听端口 | 本地进程,但监听端口 | 完全不开网络端口 |
| 上手曲线 | 命令行 | 图形界面但要选模型 | 双击装完就问 |
关键差异在**“in-process”这三个字**。Ollama 和 LM Studio 的思路是把模型跑成一个本地服务(listen 在 127.0.0.1:11434 之类),你的前端 app、你的 IDE 插件、你的脚本,通过 HTTP 去调它。这个架构的好处是解耦,坏处是:
- 用户要装两个东西——服务 + 前端
- 端口暴露有攻击面(本机上其他程序都能连)
- 序列化开销:每次请求要把 prompt/context 打成 JSON,模型输出再拼回来
Sageling 走的是另一条路:MLX 引擎作为库直接嵌进 app 进程。用户没有“服务”这个概念,模型加载后就是 app 的一部分,调用是函数调用不是 HTTP,网络端口一个都不开。
站上以前写过一篇 LM Studio Bionic,那个方向是把 LM Studio 当 agent 后端;Ollama 省钱实测 是把 Ollama 塞到 Claude Code 里当便宜替身。这两条路子本质上都还是**“开发者视角的本地化”**——省钱、可控、但还是给会写代码的人用的。
Sageling 是第一次把这套东西面向根本不会打开终端的用户打包。
MLX in-process 到底啥意思?架构一层一层拆
MLX 是 Apple 官方 2023 年底开源的机器学习框架,专为 Apple Silicon 的统一内存架构做过优化(内存不复制、CPU/GPU 共享 buffer)。llama.cpp 也支持 Metal 后端能跑,但 MLX 在 Apple Silicon 上通常吞吐更高、内存占用更省。
传统本地 AI app 的调用链:
用户 UI → HTTP Client → localhost:11434 → Ollama server → llama.cpp → Metal GPU
至少五层,跨进程通信两次(UI/Ollama、Ollama/llama.cpp 有时也算),每次请求都要经过 socket + JSON。
Sageling 的 in-process 调用链(推断,未公开源码):
用户 UI → MLX Python 绑定或 Swift MLX → Metal GPU
同一个进程地址空间,函数直接调,没有 HTTP、没有 JSON、没有 socket。
好处:
- 零延迟叠加:模型响应第一个 token 到 UI 显示,中间没有额外 IPC 开销
- 无端口暴露:本机的其他程序(包括恶意 app)都碰不到这个模型
- 打包简单:不需要“先装 Ollama 再装 UI”
代价:
- 强耦合:换引擎、换模型格式,都要 app 层配合改
- 升级不独立:MLX 出新版,Sageling 也得跟着发新版
- 调试黑盒:出问题日志都在 app 里,用户不像 Ollama 那样能
curl localhost:11434单测
对开发者来说,独立 API 服务更灵活。对普通用户来说,“看不见的东西才是好东西”——一个 app 图标,双击,能用,坏了删掉,这个心智模型 Ollama 给不了。
硬件门槛卡在哪:16 GB Mac 真够吗?
官网写得清楚:Apple Silicon Mac + ≥16 GB 统一内存 + macOS 13 及以上,首次运行下载约 8 GB 模型。
Qwen 3.5 9B 4-bit 量化后大约 5-6 GB 权重,加上 KV cache、上下文缓存、MLX runtime 本身,实际运行时占用一般在 10-13 GB 之间浮动。16 GB Mac 剩给系统和其他 app 的空间就只剩 3-6 GB。
我按站上以前那篇 本地 LLM 硬件分层实算 的经验,给几个档位标一下:
| 机型 | 内存 | 跑 Sageling 体验(推断) |
|---|---|---|
| M1 / M2 MacBook Air 16 GB | 16 GB | 能跑,但同时开 Chrome + Slack + Zoom 会开始 swap,风扇拉满 |
| M2 / M3 MacBook Pro 24 GB | 24 GB | 舒服档,日常多任务不受影响 |
| M3 / M4 Pro 32 GB | 32 GB | 富裕档,模型常驻内存不掉页 |
| M4 Max / Studio 64 GB+ | 64 GB+ | 溢出档,未来还能升级到更大模型 |
我的建议:如果你 Mac 是 16 GB 起步款、平时 Chrome 常开 30 个标签,装 Sageling 前先看看活动监视器的“内存压力”是不是常年黄色。是的话别装,装了要么慢要么整机卡。
24 GB 是一个真正的舒适起点。9B 模型跑起来 tok/s 在 M2/M3 系列上大约 15-30 tok/s(我用 Ollama 跑同尺寸模型的经验估算,MLX 版本理论上更快一点),基本能做到“说完就开始出字”。
隐私铁律:治疗师、老师、律师能不能用?
这是 Sageling 官网 FAQ 花了最多笔墨的地方。我按“合规场景”把它拆开:
HIPAA(美国医疗隐私法)
- 你可以在 HIPAA 覆盖的诊所用
- 但你自己还是要维护 HIPAA 合规的整机环境(磁盘加密、屏保锁、备份策略、访问日志)
- 不需要跟 Sageling 签 BAA(业务伙伴协议),因为它拿不到你的患者数据
FERPA(美国学生隐私法)
- 学生作业留在你 Mac 上,从来不上传
- 学校 IT 政策才是关键——很多学校不允许在办公电脑装非白名单软件
律师-委托人保密
- 模型在你 Mac 上跑,不发给任何第三方
- “无第三方在环”这一点在律师伦理审查里通常够用
中国的语境:《个人信息保护法》《数据安全法》《医疗健康信息标准》——Sageling 这种“完全本地”的架构合规成本最低。但你得自己保证:
- 电脑不丢
- 全盘加密(FileVault 一定开)
- 定期备份到自己控制的介质
- 不要把 Sageling 装在共用电脑上
Sageling 官网原话:
No. Your conversations, files, and memories stay on your Mac, and Sageling calls no outside AI service. The network is used only when a job needs the web, for downloads, and for a rating you choose to send.
翻译:会话、文件、记忆都不出 Mac,Sageling 不调外部 AI 服务。网络只在三种情况下用——你让它上网查东西、下载模型、你主动发送评分。
这三条例外我特意标出来:它不是零网络,是“默认零网络 + 明确按需使用”。用户教育没做到位,还是有可能不小心让它上一次网。
我实测下来(推断),9B 模型能干什么、干不了什么?
Sageling 刚上,我还没上手(等 dmg 下下来再补一版实测帖)。但 Qwen 3.5 9B 我在 Ollama 里跑过一段时间,边界感大致有:
能干得挺好的
- 邮件起草、修辞润色、语法检查
- 会议记录整理成条目
- 短文本翻译(中英日常语境)
- 结构化输入(把一段乱话变 JSON、变表格)
- 简单的文档问答(几千字 PDF 内的信息查询)
- 待办拆解和日历规划
能干但要看运气
- 长文档摘要(>1 万字开始漏细节)
- 代码写作(简单脚本可以,复杂业务逻辑幻觉多)
- 数据分析(能列步骤,但算出来的具体数字信不过)
- 复杂 RAG(要看 harness 怎么切 chunk)
干不了或者别指望
- 严肃的法律/医疗建议(模型规模到不了那个知识密度)
- 精确的多步推理(数学证明、编译原理级别的问题)
- 与 GPT-5 / Claude Opus 一档的“创意 + 严谨”写作
Sageling 的定位其实很聪明:它不跟 Claude Cowork 抢那种“帮我做深度分析”的活儿,抢的是“帮我做重复劳动”的活儿。官网上举的例子——写病历、批作业、雇视频师,都是模板化程度高、对模型顶层能力要求不高的场景。
9B 模型 + 好 harness + 明确任务 = 能干活。这个组合被 Sageling 团队押对了。
那 Sageling 值得装吗?三种人不适合
先说不适合的:
- 你是重度 Claude/GPT 用户,日活消息 >100 条:9B 的天花板会让你难受,你会不断回去开云 API
- 你的 Mac 内存只有 8 GB / 你还在用 Intel Mac:跑不动,Sageling 硬件门槛卡死了 Intel
- 你想用它写代码:可以,但站上写过的 Claude Code + Skills 那种复杂 agent 工作流,9B 目前撑不起来
适合的:
- 你处理敏感数据(病历、成绩、合同、财务),必须留在本地
- 你不会写代码,Ollama / LM Studio 的“先装服务再装 UI”让你头疼
- 你想让 AI 干日常重复活,不追求 SOTA 智商
- 你想第一次尝试本地 AI,愿意用 8 GB 硬盘 + 一次下载换一个私有助手
免费下载这一点特别值得说:不注册、不试用期、不砍功能。作者赌的是“先让你用上、后面再想商业化”,跟 Ollama / LM Studio 的早期打法很像。
常见问题
Q1: Sageling 是开源的吗?
A: 官网和 HN 帖子都没提到开源。目前看是免费闭源 Mac app,模型部分用 Qwen 3.5 9B(Qwen 系列本身 Apache 2.0)。如果你要求全栈可审计,等它开源再说,或者用 Ollama + Open WebUI 组合替代。
Q2: 首次下载 8 GB 模型能挑吗?
A: 官网没提可选。默认给的就是 Qwen 3.5 9B 一个包,普通用户不用做选型决策。这是刻意的产品取舍——不给选,用户就不会纠结。想选模型的,去 LM Studio。
Q3: Sageling 支持中文吗?
A: Qwen 系列是中文母语模型,中文能力比同尺寸的 Llama、Mistral 好很多。日常中文写作、邮件、翻译都够用。这是 Sageling 选 Qwen 而不选 Llama 3 8B 的一个大理由。
Q4: 跟 Claude Cowork 比,Sageling 差多少?
A: 差一个数量级。Claude Sonnet 参数量在几百 B 级别,Sageling 才 9B。硬指标(推理、长文、复杂任务)没得比。但 Sageling 有两个 Claude 永远给不了的东西——免费无上限 + 完全私有。选谁看你要什么。
Q5: 我能给 Sageling 接自己的知识库吗?
A: 官网提了“memories”是纯文本存本地磁盘的,可读可编辑可删。这暗示有内置的记忆/知识层。是不是标准 RAG、能不能接大文档库,得等实测。目前定位是“个人助手”不是“企业知识库”。
Q6: 网络断了 Sageling 还能用吗?
A: 能,这是核心卖点。模型下载完之后,飞机上、山里、办公室断网都不影响。只有你主动让它上网查东西或者更新模型时才需要联网。
Q7: 我 Mac 只有 16 GB,跑起来会不会卡到没法办公?
A: 会有影响。9B 模型 4-bit 常驻内存大概 10-13 GB,同时开 Chrome / Slack / Zoom 会开始压缩内存、频繁 swap,风扇转起来。想舒服跑 Sageling + 日常工作,24 GB 是起点,32 GB 稳。