Cactus 发 Needle 3:8–29MB 的端侧基础模型,2 到 20 层每一层都是一个可部署模型
Cactus Compute 发布 Needle 3:一个面向手机、可穿戴、机器人、智能家居、车机与单片机的端侧基础模型,整个模型是一个 8–29MB 的二进制文件。它做三件事且全在设备上完成——工具调用(给定 App 暴露的函数,选出正确的并把参数从用户原话里填满;没有工具覆盖时返回空列表而不是猜)、结构化抽取(声明数据结构,越界的文本被解码语法约束成一定能解析的字段)、以及句向量(同一模型返回向量,用于端侧的查、配、路由)。
架构上最有意思的两点是「记忆不放 FFN」和「层数即档位」:模型用哈希 n-gram 记忆表(engram)替代前馈层,121M 参数里有 70.8M 住在表里,一个 token 读 30 行而一个乘法都不做;权重压到 2.125 bit,运行时内核直接读而不解包。训练上,从 2 层到 20 层的每一层都是一个独立可部署的子网(官方叫 intelligence ladder),开发者按设备算力选深度,而不是重新训一个小模型。官方称其在与手机端工具调用的对比里胜过 10 倍参数量的模型。
核验记录
HF 仓库 Cactus-Compute/needle3 createdAt 2026-09-16T06:41:36Z 直读(Apache 2.0,模型卡全文直读);官方产品页 cactuscompute.com/needle 正文「Today we release Needle 3」直读,但该页为 Next.js 渲染、页面内无 datePublished 字段(仅 sitemap 无 lastmod);官方工程博客 9/17–9/19 多篇(intelligence-ladders 9/17、engram 9/19、cact-format 9/18)引用「shipping Needle 3」做交叉侧证。发布日取权重仓时间戳 9/16,非官方公告日(官方未公布单独发布公告页)。全部性能数字为官方自报。
← 上一篇Mistral×Mozilla:Firefox Smart Window 改用 Mistral 模型,合作承诺零数据保留下一篇 →蚂蚁开源 Realtime-Venus:9B 全双工音视频交互,说话中可委派后台任务