正在刊行早报 · Morning Brief
2026-10-07所有内容
随机比特 · Random Bits

OpenAI 的合同 Agent:快了近一半,平均得分却只有 55%

2026-10-07AI Engineering / Systemsrbits.uk
OpenAI 的合同 Agent:快了近一半,平均得分却只有 55%

OpenAI 让 GPT-6 Astra 配置合同审批等流程:11 项研究任务的平均得分为 55%,估计耗时却从 37 分钟降至 19.2 分钟。操作提速了,业务规则仍可能漏掉。

🚀 模型发布与部署边界

• Mistral Large 4 开放 API 预览 —— 原生多模态模型拥有一万亿总参数、490 亿激活参数,权重计划月底发布。现在可以试用 API,自部署还得等;厂商评测成绩也需要用自己的业务验证。

• Reflection 发布 Beam —— 这款编码与 Agent 模型拥有 5010 亿总参数、230 亿激活参数,目前接受提前访问申请,权重与技术报告计划月底公布。激活参数少,并不意味着部署时只需装下这部分权重。

• EmbeddingGemma 2 把多模态检索搬到本地 —— 7.4 亿参数模型将文本、图像、音频和视频映射到同一向量空间,采用 Apache 2.0 许可证。官方量化测试中,纯文本权重最低约需 191MB 活跃内存,离线搜索的部署门槛进一步下降。

🛠️ 工程工具与安全准入

• rea:让 Agent 检查没有源码的应用 —— 项目通过 MCP 连接二进制、JavaScript、Electron 等分析工具,在本地输出证据与未知项。本次属于热榜发现;原生二进制深度分析仍依赖 Hopper、Ghidra 或 IDA 等工具。

• Anthropic 将网络安全准入分成三档 —— 扩大的 CVP 分为防御、红队和专项访问,按资质与任务范围减少阻断。红队档目前仅面向组织,并要求获得目标系统的测试授权;更强能力对应更严格的准入与控制。

🚨 企业工作流与执行可靠性

• OpenAI 与 Ironclad 用合同流程训练 Agent —— 11 项任务各设 8—50 个评分标准,检查审批规则、模板与法律条款配置。GPT-6 Astra 平均得分为 55%,较对照模型提高约 32%;完整流程的规则验收,仍是人工监督的重点。

• Atlassian 扩大 OpenAI 合作 —— 官方披露,超过 3000 名 Atlassian 开发者已在终端、IDE 和代码评审中使用 Codex。合作将模型接入 Rovo 与企业知识图谱,更深入的 Jira 任务分配和进度追踪仍处于探索阶段。

📚 延伸阅读

• OpenAI:与 Ironclad 构建合同工作流训练任务及评估标准 https://openai.com/index/advancing-computer-use-with-ironclad

• Google DeepMind:EmbeddingGemma 2 的架构、内存与本地部署 https://deepmind.google/blog/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model/

• Anthropic:Cyber Verification Program 三档准入与安全控制 https://www.anthropic.com/news/cyber-verification-program

随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。