Sageling:给不会写代码的人的第一个本地 AI 助手,MLX in-process 跑 Qwen 3.5 9B

阅读时长:16分钟

Claude Cowork、ChatGPT Team、Cursor Business,一个月 20 美元起,谁付得起?付得起的又一半不敢往里贴东西——治疗师的会谈记录、老师批的学生作业、律师起草的动议,一句“数据可能被用来改进模型”就够让人手抖。

Sageling 昨天在 Hacker News 上冒出来(Show HN,2 points,冷启动),瞄的就是这块夹在“付不起”和“不敢用”中间的空白:Mac 端本地 AI 助手,MLX in-process 跑 Qwen 3.5 9B,模型直接嵌进 app,一句网络都不打。

我看了官网和 HN 帖子,结合我用 Ollama、LM Studio、Claude Code 那一堆家伙的经验,觉得这条路子跟站上以前写过的本地 AI 都不太一样。今天就拆一拆。

TL;DR

  • Sageling 面向非开发者,MLX in-process 跑 Qwen 3.5 9B,8 GB 模型首次下载后完全离线可用
  • 走的不是 Ollama / LM Studio 那套“本地 API + 前端调”的路子,模型直接编进 app,砍掉一层 localhost 服务
  • 硬件门槛:Apple Silicon Mac + ≥16 GB 统一内存 + macOS 13 及以上
  • 目标场景:治疗师病历、老师批作业、律师文书、包含敏感信息的日常工作
  • 免费下载,不上传对话文件,记忆以纯文本存本地磁盘,可读可编辑可删

为什么非开发者用不起,也用不敢云 AI?

我朋友里那批不写代码的——一个做心理治疗,一个大学助教改考卷,还有个做劳动仲裁——她们对 AI 的印象基本停留在“能不能帮我写个邮件”。

问她们为什么不上 Claude Cowork、ChatGPT Plus,答案高度一致:

  • :20 美元一个月,用两次就觉得亏;上限一到就催升级到 200 美元
  • 心里没底:一份治疗记录、一份学生成绩单、一份合同草稿,谁敢往云端灌?平台隐私声明写得再漂亮,训练用不用、员工能不能看、数据存哪个国家,这些普通人根本弄不清

Sageling 的作者在 HN 上把这两个痛点讲得直白(Show HN 原帖):

  1. Well, I don’t wanna pay a bunch of money for it, and the $20 plans run out real fast.
  2. I’m dealing with sensitive info (student grades, therapy notes, legal work, etc) and I don’t wanna give it to anyone.

这两句话套在中国用户身上一样成立。你把 API key 塞给 Cursor 就等于把项目源码交给模型商,把公司报表贴给 ChatGPT 就等于把财务数据搬出内网,把病人档案传给云端就是直接违规。

本地 AI 不是新东西,Ollama、LM Studio 都能跑。但那些是给会写代码的人玩的——你得懂什么叫“模型下载”“量化版本”“API 端口”“system prompt”。让一个心理治疗师去装 Ollama、拉模型、写 prompt,是一次劝退。

Sageling 想解决的就是这个“最后一米”:把 MLX 引擎、模型、agent 框架、UI 全打包成一个 dmg,双击安装,跟装 Notion 一样。

Sageling 到底跟 Ollama、LM Studio 差在哪?

这是我最想拆的点。表面上看都是“Mac 本地跑开源模型”,架构差别其实很大。

维度 Ollama LM Studio Sageling
引擎 llama.cpp(可选 MLX 预览) llama.cpp / MLX 二选一 MLX(in-process)
模型交付方式 CLI 拉,本地服务化 GUI 拉,本地服务化 首次启动下载 ~8 GB,直接嵌进 app
对外接口 OpenAI 兼容 API @ 11434 OpenAI 兼容 API 可选 无(in-process 调用,不开端口)
目标用户 开发者 半技术玩家 完全的非开发者
Agent 能力 没有(要自己拼 harness) 没有(自己接 client) 内置 harness + skills,直接用
隐私边界 本地进程,但监听端口 本地进程,但监听端口 完全不开网络端口
上手曲线 命令行 图形界面但要选模型 双击装完就问

关键差异在**“in-process”这三个字**。Ollama 和 LM Studio 的思路是把模型跑成一个本地服务(listen 在 127.0.0.1:11434 之类),你的前端 app、你的 IDE 插件、你的脚本,通过 HTTP 去调它。这个架构的好处是解耦,坏处是:

  1. 用户要装两个东西——服务 + 前端
  2. 端口暴露有攻击面(本机上其他程序都能连)
  3. 序列化开销:每次请求要把 prompt/context 打成 JSON,模型输出再拼回来

Sageling 走的是另一条路:MLX 引擎作为库直接嵌进 app 进程。用户没有“服务”这个概念,模型加载后就是 app 的一部分,调用是函数调用不是 HTTP,网络端口一个都不开。

站上以前写过一篇 LM Studio Bionic,那个方向是把 LM Studio 当 agent 后端;Ollama 省钱实测 是把 Ollama 塞到 Claude Code 里当便宜替身。这两条路子本质上都还是**“开发者视角的本地化”**——省钱、可控、但还是给会写代码的人用的。

Sageling 是第一次把这套东西面向根本不会打开终端的用户打包。

MLX in-process 到底啥意思?架构一层一层拆

MLX 是 Apple 官方 2023 年底开源的机器学习框架,专为 Apple Silicon 的统一内存架构做过优化(内存不复制、CPU/GPU 共享 buffer)。llama.cpp 也支持 Metal 后端能跑,但 MLX 在 Apple Silicon 上通常吞吐更高、内存占用更省。

传统本地 AI app 的调用链

用户 UI  →  HTTP Client  →  localhost:11434  →  Ollama server  →  llama.cpp  →  Metal GPU

至少五层,跨进程通信两次(UI/Ollama、Ollama/llama.cpp 有时也算),每次请求都要经过 socket + JSON。

Sageling 的 in-process 调用链(推断,未公开源码)

用户 UI  →  MLX Python 绑定或 Swift MLX  →  Metal GPU

同一个进程地址空间,函数直接调,没有 HTTP、没有 JSON、没有 socket。

好处:

  • 零延迟叠加:模型响应第一个 token 到 UI 显示,中间没有额外 IPC 开销
  • 无端口暴露:本机的其他程序(包括恶意 app)都碰不到这个模型
  • 打包简单:不需要“先装 Ollama 再装 UI”

代价:

  • 强耦合:换引擎、换模型格式,都要 app 层配合改
  • 升级不独立:MLX 出新版,Sageling 也得跟着发新版
  • 调试黑盒:出问题日志都在 app 里,用户不像 Ollama 那样能 curl localhost:11434 单测

对开发者来说,独立 API 服务更灵活。对普通用户来说,“看不见的东西才是好东西”——一个 app 图标,双击,能用,坏了删掉,这个心智模型 Ollama 给不了。

硬件门槛卡在哪:16 GB Mac 真够吗?

官网写得清楚:Apple Silicon Mac + ≥16 GB 统一内存 + macOS 13 及以上,首次运行下载约 8 GB 模型。

Qwen 3.5 9B 4-bit 量化后大约 5-6 GB 权重,加上 KV cache、上下文缓存、MLX runtime 本身,实际运行时占用一般在 10-13 GB 之间浮动。16 GB Mac 剩给系统和其他 app 的空间就只剩 3-6 GB。

我按站上以前那篇 本地 LLM 硬件分层实算 的经验,给几个档位标一下:

机型 内存 跑 Sageling 体验(推断)
M1 / M2 MacBook Air 16 GB 16 GB 能跑,但同时开 Chrome + Slack + Zoom 会开始 swap,风扇拉满
M2 / M3 MacBook Pro 24 GB 24 GB 舒服档,日常多任务不受影响
M3 / M4 Pro 32 GB 32 GB 富裕档,模型常驻内存不掉页
M4 Max / Studio 64 GB+ 64 GB+ 溢出档,未来还能升级到更大模型

我的建议:如果你 Mac 是 16 GB 起步款、平时 Chrome 常开 30 个标签,装 Sageling 前先看看活动监视器的“内存压力”是不是常年黄色。是的话别装,装了要么慢要么整机卡。

24 GB 是一个真正的舒适起点。9B 模型跑起来 tok/s 在 M2/M3 系列上大约 15-30 tok/s(我用 Ollama 跑同尺寸模型的经验估算,MLX 版本理论上更快一点),基本能做到“说完就开始出字”。

隐私铁律:治疗师、老师、律师能不能用?

这是 Sageling 官网 FAQ 花了最多笔墨的地方。我按“合规场景”把它拆开:

HIPAA(美国医疗隐私法)

  • 你可以在 HIPAA 覆盖的诊所用
  • 但你自己还是要维护 HIPAA 合规的整机环境(磁盘加密、屏保锁、备份策略、访问日志)
  • 不需要跟 Sageling 签 BAA(业务伙伴协议),因为它拿不到你的患者数据

FERPA(美国学生隐私法)

  • 学生作业留在你 Mac 上,从来不上传
  • 学校 IT 政策才是关键——很多学校不允许在办公电脑装非白名单软件

律师-委托人保密

  • 模型在你 Mac 上跑,不发给任何第三方
  • “无第三方在环”这一点在律师伦理审查里通常够用

中国的语境:《个人信息保护法》《数据安全法》《医疗健康信息标准》——Sageling 这种“完全本地”的架构合规成本最低。但你得自己保证:

  • 电脑不丢
  • 全盘加密(FileVault 一定开)
  • 定期备份到自己控制的介质
  • 不要把 Sageling 装在共用电脑上

Sageling 官网原话

No. Your conversations, files, and memories stay on your Mac, and Sageling calls no outside AI service. The network is used only when a job needs the web, for downloads, and for a rating you choose to send.

翻译:会话、文件、记忆都不出 Mac,Sageling 不调外部 AI 服务。网络只在三种情况下用——你让它上网查东西、下载模型、你主动发送评分。

这三条例外我特意标出来:它不是零网络,是“默认零网络 + 明确按需使用”。用户教育没做到位,还是有可能不小心让它上一次网。

我实测下来(推断),9B 模型能干什么、干不了什么?

Sageling 刚上,我还没上手(等 dmg 下下来再补一版实测帖)。但 Qwen 3.5 9B 我在 Ollama 里跑过一段时间,边界感大致有:

能干得挺好的

  • 邮件起草、修辞润色、语法检查
  • 会议记录整理成条目
  • 短文本翻译(中英日常语境)
  • 结构化输入(把一段乱话变 JSON、变表格)
  • 简单的文档问答(几千字 PDF 内的信息查询)
  • 待办拆解和日历规划

能干但要看运气

  • 长文档摘要(>1 万字开始漏细节)
  • 代码写作(简单脚本可以,复杂业务逻辑幻觉多)
  • 数据分析(能列步骤,但算出来的具体数字信不过)
  • 复杂 RAG(要看 harness 怎么切 chunk)

干不了或者别指望

  • 严肃的法律/医疗建议(模型规模到不了那个知识密度)
  • 精确的多步推理(数学证明、编译原理级别的问题)
  • 与 GPT-5 / Claude Opus 一档的“创意 + 严谨”写作

Sageling 的定位其实很聪明:它不跟 Claude Cowork 抢那种“帮我做深度分析”的活儿,抢的是“帮我做重复劳动”的活儿。官网上举的例子——写病历、批作业、雇视频师,都是模板化程度高、对模型顶层能力要求不高的场景。

9B 模型 + 好 harness + 明确任务 = 能干活。这个组合被 Sageling 团队押对了。

那 Sageling 值得装吗?三种人不适合

先说不适合的:

  1. 你是重度 Claude/GPT 用户,日活消息 >100 条:9B 的天花板会让你难受,你会不断回去开云 API
  2. 你的 Mac 内存只有 8 GB / 你还在用 Intel Mac:跑不动,Sageling 硬件门槛卡死了 Intel
  3. 你想用它写代码:可以,但站上写过的 Claude Code + Skills 那种复杂 agent 工作流,9B 目前撑不起来

适合的:

  • 你处理敏感数据(病历、成绩、合同、财务),必须留在本地
  • 你不会写代码,Ollama / LM Studio 的“先装服务再装 UI”让你头疼
  • 你想让 AI 干日常重复活,不追求 SOTA 智商
  • 你想第一次尝试本地 AI,愿意用 8 GB 硬盘 + 一次下载换一个私有助手

免费下载这一点特别值得说:不注册、不试用期、不砍功能。作者赌的是“先让你用上、后面再想商业化”,跟 Ollama / LM Studio 的早期打法很像。

常见问题

Q1: Sageling 是开源的吗?

A: 官网和 HN 帖子都没提到开源。目前看是免费闭源 Mac app,模型部分用 Qwen 3.5 9B(Qwen 系列本身 Apache 2.0)。如果你要求全栈可审计,等它开源再说,或者用 Ollama + Open WebUI 组合替代。

Q2: 首次下载 8 GB 模型能挑吗?

A: 官网没提可选。默认给的就是 Qwen 3.5 9B 一个包,普通用户不用做选型决策。这是刻意的产品取舍——不给选,用户就不会纠结。想选模型的,去 LM Studio。

Q3: Sageling 支持中文吗?

A: Qwen 系列是中文母语模型,中文能力比同尺寸的 Llama、Mistral 好很多。日常中文写作、邮件、翻译都够用。这是 Sageling 选 Qwen 而不选 Llama 3 8B 的一个大理由。

Q4: 跟 Claude Cowork 比,Sageling 差多少?

A: 差一个数量级。Claude Sonnet 参数量在几百 B 级别,Sageling 才 9B。硬指标(推理、长文、复杂任务)没得比。但 Sageling 有两个 Claude 永远给不了的东西——免费无上限 + 完全私有。选谁看你要什么。

Q5: 我能给 Sageling 接自己的知识库吗?

A: 官网提了“memories”是纯文本存本地磁盘的,可读可编辑可删。这暗示有内置的记忆/知识层。是不是标准 RAG、能不能接大文档库,得等实测。目前定位是“个人助手”不是“企业知识库”。

Q6: 网络断了 Sageling 还能用吗?

A: 能,这是核心卖点。模型下载完之后,飞机上、山里、办公室断网都不影响。只有你主动让它上网查东西或者更新模型时才需要联网。

Q7: 我 Mac 只有 16 GB,跑起来会不会卡到没法办公?

A: 会有影响。9B 模型 4-bit 常驻内存大概 10-13 GB,同时开 Chrome / Slack / Zoom 会开始压缩内存、频繁 swap,风扇转起来。想舒服跑 Sageling + 日常工作,24 GB 是起点,32 GB 稳。

相关阅读

© 2026 softon.top

本站已稳定运行 249 天 13 小时 · 112 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-09-07 21:18:30 CST