先说结论,好让你决定要不要往下读。
Nightcrawler 是一个真项目,不是概念视频,也不是套皮 Demo。它把一个 1.2B 参数的模型跑在一部 OnePlus 8 的 Adreno GPU 上,让这个小模型去挑目标、选工具、执行命令、匹配 CVE、写结构化报告。整个过程不联网、不调 API、不走云推理。作者自己家网络里挂着跑了 3 个月。
也就是说,“手机 AI 黑客工具箱"这件事,第一次不是营销话术,是能编译能跑的开源代码。
但——注意这个"但”——它不是漫威片里那种一按按钮就拿到域控的东西。作者自己在 Hacker News 上明说:模型输出一条能用的命令的概率大概 50%。剩下 50% 都靠工程胶水兜住。
所以这篇文章想干一件事:把 Nightcrawler 的架构、真实性能、能做什么不能做什么,以及为什么它值得被认真讨论,讲清楚。是"真家伙还是极客玩具"这个问题,答案取决于你从哪个维度看。
幻想:兜里的 AI 黑客
想象一下这个画面。
你坐在咖啡馆,手里一部普通安卓。你打开一个 App,输入一个 IP 段(当然是你自己家的),点"开始"。手机屏幕暗着放兜里,你继续喝咖啡。半小时后拿出来一看:
- 扫到了 8 台在线主机
- 认出 3 台跑着老版本 nginx
- 从本地 CVE 库里匹配到 2 个高危漏洞
- 生成了一份 Markdown 结构的报告,写了每一步为什么这么做
没有云、没有订阅、没有把你的内网流量喂给 OpenAI。整个过程是那部 12GB 内存的老手机自己完成的。
这是 Nightcrawler 想推销的画面。听着像 UP 主标题党?我第一反应也是。但翻完 GitHub 仓库、Hacker News 作者亲自答疑的 comment、以及第三方媒体的独立报道后,我把结论收窄成一句话:
画面是真的,但每个像素都比营销号说的粗糙。
想清楚这句话,剩下的内容才有意义。
硬件账本:二手手机能不能扛住
我们先算一笔硬件账,这是理解 Nightcrawler 最快的一条路。
作者用的机器是 OnePlus 8,2020 年的旗舰,二手市场大概 90 美元一台。芯片是骁龙 865,GPU 是 Adreno 650。内存 12GB。系统是刷了 Kali NetHunter 的 Android,需要 root。
这里有几个反常识点得说清楚:
第一,不是所有安卓都能跑。Nightcrawler 依赖 Adreno GPU 做本地推理。它调用的是骁龙芯片 GPU 的通用计算能力,不是 NPU,也不是 CPU 硬扛。你拿一部联发科天玑或者三星 Exynos 上去,能不能跑要看 GPU 生态,不能拍胸脯说"安卓通吃"。
第二,root + NetHunter 是硬门槛。渗透工具要抓包、要开原始 socket、要跑 nmap 这种依赖 raw packet 的东西,没 root 权限根本走不动。这不是 Nightcrawler 特有的问题,是安卓做安全工具的共同底线。
第三,12GB 内存是最低要求。1.2B 模型量化后大概占几个 GB,但推理时上下文窗口、KV cache、SQLite、playbook 引擎、报告生成器都在一起吃内存。8GB 的机器你可以试,但会崩。
为什么选这么老的手机? 因为作者要证明的不是"手机能跑 AI",而是**“一部旧手机能跑一整套渗透工作流”**。这个立意本身就在讽刺当下 AI 圈的硬件军备赛。你不需要 H100,不需要 128GB 内存的工作站,一部小学生都嫌旧的手机就够。
这个立意如果成立,那它挑战的不是 Kali on Android,而是"云端 AI 渗透"整个赛道的定价模型。
慢镜头:这个 1.2B 模型到底在干什么
现在我们把镜头拉到软件内部。作者用的模型是 LFM2.5-1.2B(Liquid AI 那条线的模型)。1.2B 是什么概念?
- Llama 3 8B 的 1/7
- GPT-4 的估算参数量的 1/1500 左右
- Claude Opus 4.5 完全不是一个量级的对手
所以先泼冷水:这个模型不会自己想出零日漏洞,也不会写出优雅的 exploit。它做的事情非常聚焦:
- 看当前状态(扫描结果、已知主机、上一步输出)
- 从工具库里挑一个工具(nmap、nikto、gobuster 这类基础货)
- 生成对应的命令行参数
- 决定下一步扫哪个目标
关键在于第 3 步——生成命令。作者亲口说了这个数字:能用的命令生成率大概 50%。
50% 是什么概念?一半时间它输出的是垃圾。参数写错、目标 IP 拼错、flag 组合互斥、路径不存在。你要是让这个模型直接对着真实网络输命令,会有一半概率是废动作或者噪音扫描。
这就是 Nightcrawler 最诚实的地方,也是它最工程化的地方。作者没有假装模型很聪明,而是围绕这个"一半时间犯错"的现实设计了一整套兜底系统。
骨架拆解:真正在干活的四个模块
Nightcrawler 之所以能实际跑起来 3 个月不崩,靠的不是模型多强,是工程结构做得扎实。核心有四块:
1. Scope enforcement proxy(作用域执行代理)
这是我看下来最喜欢的设计。
模型输出一条命令,比如 nmap -sV 10.0.0.0/24。这条命令不会直接进 shell。它会先进一个独立的代理层,代理层做两件事:
- 对照白名单:这个 IP 段在不在你允许的作用域里?超出就拒绝。
- 对照黑名单和危险模式:有没有可能误伤(比如扫到网关引发风控)?
换句话说,Nightcrawler 不信任模型的合规判断。它把"是否在合法范围"这个问题从模型手里抢过来,交给一个确定性的、可审计的代理程序。
这个设计的意义大于它看起来的样子。你回想一下现在市面上多少 Agent 项目在讨论"Agent 安全",答案通常是"让模型学得更乖"或"加个 system prompt 说别做坏事"。Nightcrawler 走的是另一条路:默认模型不可信,用外部程序做红线。
这才是 Agent 时代该有的安全观。
2. Per-host SQLite memory(每主机持久化记忆)
模型上下文窗口有限,1.2B 模型的窗口更是紧张。所以 Nightcrawler 用 SQLite 给每台目标主机建了独立的记忆库:
- 这台机器暴露了哪些端口
- 之前扫出来什么版本
- 之前跑过哪些命令
- 哪些命令失败过(避免重复犯错)
模型每次决策前,先从 SQLite 里拉这台主机的历史压进 prompt。这种做法把"AI Agent 的健忘症"用一个几十行的胶水层解决了。
这不是新思路,但在移动端资源紧张的场景下做到位,非常见功力。
3. Playbook engine(多步剧本引擎)
不是所有事情都让模型来决定。基础的、可预测的、成熟的渗透流程被硬编码成 playbook。比如:
- 扫端口 → 出结果 → 挑开着的 HTTP 服务 → 上 nikto/gobuster
- 出目录 → 找到登录页 → 跑弱密码字典
这些流程本来就有成熟套路,不需要 LLM 来"创造"。Playbook 引擎负责把"可自动化的机械动作"从模型手里拿走,让模型只在分支点做决策。
这种做法非常诚实:你越是把 LLM 只用在真正需要判断的地方,整体系统的可靠性就越高。反面例子是那种"什么都交给 GPT-4 决定"的 Agent 项目,最后哪一步都不靠谱。
4. Local CVE database(本地漏洞库)
版本扫出来了,怎么知道是不是老版本、有没有已知漏洞?
不是问模型(模型的 CVE 知识陈旧且不可靠)。是查本地 CVE 数据库。数据库是离线的、可更新的、可审计的。
这一步再一次绕过了模型的幻觉。
性能数字:慢,但慢得可以接受
前面吹了架构,现在讲讲实测数字,别让你觉得我在做营销。
作者给的原始数字:
- Prompt 处理:约 115 tokens/秒
- 生成速度:约 13 tokens/秒
翻译一下:模型"看"的速度还行,“想"的速度非常慢。13 tokens/秒是什么感觉?大概你在电脑上跑 GPT-3.5 的 1/10 到 1/15。
但这个速度够用。为什么?因为 Nightcrawler 的架构决定了它不是在做实时对话,而是在跑一个漫长的自主任务。你把手机放兜里,它自己扫。半小时、一小时、几小时都可以。
速度慢在这里不是问题,能不能自己稳定跑下去才是问题。作者的 3 个月无中断运行是一个不错的答案。
云端 vs 本地:一笔真实的成本账
现在我们把 Nightcrawler 放进坐标系里。它对标的不是别的手机工具,是云端 AI 渗透方案(PentestGPT 那一类)。
| Nightcrawler | 云端 AI 渗透 | |
|---|---|---|
| 硬件 | 二手 OnePlus 8 ≈ 90 美元 | 你自己的机器 |
| 推理成本 | 0 | 按 token 算,几十到几百美元/月 |
| 数据出境 | 无 | 你的目标信息全给 OpenAI/Anthropic |
| 断网可用 | 可以 | 完全不行 |
| 模型强度 | 1.2B(弱) | GPT-4/Claude(强) |
| 命令生成正确率 | ~50% | 高很多 |
| 工具生态 | Kali NetHunter | 你自己搭 |
| 法律风险面 | 全在本地 | 云服务商 ToS 合规 |
| 部署门槛 | 刷 NetHunter + root | 一个 API key |
这张表的关键点是:Nightcrawler 不是想赢在能力上,是想赢在"能力/成本"和"隐私"上。
对红队来说,客户经常会明确要求"不允许把目标信息发到任何第三方 API”。这种硬性合规下,云端 AI 渗透直接被判死刑。Nightcrawler 这种离线的、可审计的、air-gappable 的方案就有了独家优势。
对个人研究者来说,你不想每个月付几百美金给 OpenAI 只为了让它帮你选 nmap 参数。这时候 Nightcrawler 的边际成本是 0。
它不能做什么
我在正文的一半就把架构讲完了,现在是时候讲它做不到的事。这些是我最担心 Nightcrawler 会被小视频号包装掉的部分。
不能替代人类经验
模型只有 1.2B。它不会做"高段位"决策。它不会看到一个奇怪的 header 就联想到某个冷门框架的漏洞。它不会在扫描结果里嗅到那种"不对劲"的味道。它只能做模式匹配和机械推进。
真正的高阶红队工作,本质是直觉、经验和创造力的组合。Nightcrawler 是"下限工具",把 60 分的机械劳动自动化了,让高段位的人能把精力花在 90 分的判断上。它不是"替代红队",是"让红队的初级工作不必再人肉做"。
不能对付真实企业网络
这是 Hacker News 上有人直接问作者的问题:“你在真实企业网络里测过吗?”
作者的诚实回答大意是:在家网络跑了 3 个月是真的,但企业网络没测过。企业网络里 IDS/IPS/EDR 一堆,1.2B 模型这种"胡乱输命令"的方式,第一波扫描就会被抓。而且现代企业的攻击面复杂度远超一部旧手机的处理能力。
Nightcrawler 的舒适区是:家庭网络、小公司内网、CTF 靶场、自建实验室。这四个场景够用了,但你不能把它当成企业级红队工具。
不能绕过法律
这一段本来我不想写,但太多人看到"AI 黑客手机"就会脑补歪路子。我必须写清楚。
未经授权对他人的网络、系统、设备做任何扫描或探测,都是违法的。中国有《网络安全法》《刑法 285 条》,美国有 CFAA,欧洲有 NIS2 和各国单独立法。你手机上装的是"AI 渗透 Agent",跟你钱包里装的是"AI 撬锁工具",本质是一样的:合法的用法只有一种——你自己拥有的、或者你被合法授权测试的目标。
Nightcrawler 的 scope enforcement 层是给你帮忙做合规的,不是给你免罪的。你把非法目标写进白名单,那是你的锅,不是工具的锅。
红线只有一条:授权。授权。授权。
那么,“真家伙还是极客玩具”
回到标题的问题。答案是——它同时是两者,取决于你怎么看。
如果你把 Nightcrawler 当成"一部手机自动打穿你家路由器"的营销片:它是玩具。1.2B 模型 50% 犯错率,你指望它替代真人?不可能。
如果你把 Nightcrawler 当成一个"教科书级的 Agent 工程案例":它是真家伙,而且是宝藏。
- 它用最小的模型 + 最强的工程胶水,跑起了一个真实的自主任务
- 它用外部安全代理,而不是"让模型自己乖"来做合规
- 它用 SQLite 解决 Agent 记忆问题
- 它用 Playbook 引擎解决"什么该给 LLM,什么不该给"
- 它用本地 CVE 数据库解决"事实性知识"从哪来
- 它证明了一部 90 美元的旧手机能跑完这一切
这些设计模式,几乎每一条都可以搬到你自己做的 AI Agent 项目里去。它是一份公开的、能跑的、经过 3 个月压测的 Agent 架构参考实现。这价值远比"哦一部手机跑 AI 黑客"更持久。
我个人的评价:这是 2026 年目前为止最诚实的 Agent 项目之一。作者没有藏 50% 命令生成率这种难堪数字。他把架构、限制、场景都讲清楚。这在满地跑的"AI + X"营销号项目里,是奢侈品。
谁应该关注它
如果你是——
- 搞 Agent 工程的:去读源码,看 scope enforcement 代理怎么写、SQLite memory 怎么切片进 prompt、Playbook 怎么和 LLM 分工。这些代码值几篇论文。
- 搞本地 LLM 推理的:看它怎么在 Adreno GPU 上把 1.2B 模型压到能跑,怎么处理移动端热管理和电量。
- 搞企业红队的:不要当主力工具,但可以研究它的思路。你自己搭一个更强模型 + 类似架构的东西,可能真能解决你客户的"数据不能出境"痛点。
- 搞个人安全研究/CTF 的:直接上手玩。90 美元的手机 + 一晚上刷 NetHunter,就能在你自己的靶场里练手。
如果你是——
- 想找一个"帮我打穿邻居 WiFi"的工具的:右上角关掉这篇文章。你走错门了。
- 想找一个"零配置一键式黑客软件"的:也走错门了。Nightcrawler 是开发者项目,不是消费级 App。
尾声:小模型 + 强工程 > 大模型 + 弱工程
我最想留给你的话,其实和 Nightcrawler 本身没关系,是它证明的一个观点:
在 Agent 领域,工程质量比模型大小重要。
这几年 AI 圈的默认叙事是"越大越好",参数一个比一个吓人。Nightcrawler 走的是反方向:接受模型小、接受模型笨,用外部程序做兜底、做记忆、做合规、做可靠性。
它 50% 的命令生成率意味着模型一半时间在犯错。但你看整个系统的输出——3 个月无中断、结构化报告可读、扫描目标不越界——你会发现这个系统作为整体,比任何一个组件都靠谱。
这才是 Agent 时代真正的工程学。
你不必等 GPT-5、Claude 5、Gemini 3。你现在就可以用一个 1.2B 的模型,加上正确的架构,做出能干活的东西。
Nightcrawler 用一部二手手机把这个道理证明给你看了。
要不要在你自己的项目里试一下?