Cactus 发布 Needle 3:8-29MB 小模型自动化能力对标 DeepSeek V4 Flash
Cactus 公司发布 Needle 3,一个专注于工具调用和结构化输出的自动化模型,体积仅 8-29MB。该模型通过智能分层设计,让不同规模的子网络都能部署,其中 4 层版本在微调后可匹配 DeepSeek V4 Flash 的表现。对开发者而言,这意味着可以在树莓派等小型设备上本地运行自动化任务。
Cactus 公司发布了 Needle 3,这是其自动化模型的第三次迭代。与通用聊天模型不同,Needle 3 专注于工具调用和结构化 JSON 输出,不提供对话功能。如果用户请求没有匹配到任何已声明的工具,模型会返回空列表,而不是猜测一个答案。
Needle 3 的核心特性是智能分层(Intelligence Laddering)。模型从 2 层到 20 层,每一层都是一个可部署的子网络,参数量从 2500 万到 1.21 亿不等,以 2-bit 量化后打包成 8-29MB 的二进制文件。开发者可以根据设备性能选择合适大小的子网络,每个子网络都支持微调。据称,4 层版本在针对下游任务微调一个 epoch 后,可以匹配 DeepSeek V4 Flash 的表现。
模型支持文本提示、工具定义或提取模式作为输入,输出结构化 JSON。训练使用了 360B token 的专有结构化数据集。在树莓派 5 上,解码速度可达每秒 400-4000 token,预填充速度每秒 1-10000 token。架构上采用阶梯式简单注意力网络,比同配置的 transformer 每 token 节省超过 2 倍的 MFLOPs。
Cactus 提供了 Python 包,开发者可以通过装饰器定义工具,模型会自动选择正确的工具并填充参数。还支持正则表达式触发器和 Pydantic 模型提取。官方展示的应用场景包括智能家居控制、机器人指令、手机端操作、可穿戴设备数据处理、AR 眼镜导航、车载系统、桌面控制和本地语义搜索等。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。