AWS Strands Decider 2B:约 115 毫秒做一次决策的开源小模型
AWS 的 Strands Agents 团队发布了 Strands Decider 2B,这是一个基于 Qwen3.5-2B-Base 构建的 Apache-2.0 决策模型。它不生成文本,而是在一次前向传播中返回选项、是/否概率以及带校准置信度的分数,在 RTX 3090 上中位延迟约 115 毫秒,在 JevBench 公开集上得分 0.723。它的定位是 AI Agent 中的快速本地路由、工具选择和护栏判断。值得关注的是,Agent 决策环节长期依赖大模型生成文本再解析,成本和延迟都高,这个模型把决策压缩成一次分类式推理,为本地化、低延迟的 Agent 控制层提供了新选项。影响人群是 Agent 框架开发者、需要本地护栏的团队和做工具路由的工程师。下一步建议在自有路由或护栏任务上复现评测,对比其与提示词方案在准确率和延迟上的差异。