Claude Sonnet 5.5 的 token 单价与上一代相同,Anthropic 却报告任务成本最多下降 30%:完成同样的工作,它通常用更少的 token。选模型只看价目表,可能算错账。
🚀 模型升级与任务成本
• Sonnet 5.5:同价,少用 token —— Anthropic 称输出速度提高超过 30%,其测试中的任务成本最多降低 30%。推理强度调高仍会增加消耗,选型应比较完成任务的总成本与质量。官方测试说明
• GPT-6.1 Sol:以 Astra 五分之一的单价接近其能力 —— OpenAI 将标准输入、输出价格分别定为每百万 token 2 美元、10 美元,并报告多项任务表现接近 Astra。价格优势明确,实际能否替换仍取决于自己的任务成功率。
🛠️ 企业检索与文档处理
• Embed 5:两档模型共用一个向量空间 —— Cohere 的 Pro 与 Fast 可共享索引,用 Pro 建库、Fast 查询,无需重新索引。团队可以分别选择建库质量与查询成本,但仍需用真实文档验证检索效果。
• Cohere Parse:保留表格结构,不只识别文字 —— 产品将复杂文档转成 Markdown,并返回视觉元素的位置框,API 标价为每千页 1.50 美元。知识库答错之前,先检查表格行列、阅读顺序有没有在解析时丢失。产品说明
🚨 业务落地与安全边界
• Safeway 接入 ChatGPT 买菜流程 —— 用户可从菜谱、照片或购物清单生成购物车,再跳转 Safeway 结账。Albertsons 案例把助手接到了具体交易入口,但未披露足以验证业务收益的量化结果。
• OpenAI 披露协同提取隐藏推理活动 —— 官方称,相关提示模式涉及超过 15,000 个用户,并将核心活动簇归于与 Moonshot AI 有关联的人员;这是 OpenAI 的归因,尚非独立调查结论。事件暴露的是交互与推理保护路径的风险,不是数据库被攻破。
• 前沿训练 safety case:训练继续前,先提交安全证据 —— OpenAI 提出早期指南,包括检查奖励作弊、强化隔离、保留不可改写的执行记录,以及对异常告警暂停训练。它提供了可检查的操作方向,仍不是已经验证充分的安全保证。
📚 延伸阅读
• Anthropic:Sonnet 5.5 的任务成本与推理强度对比 https://www.anthropic.com/claude-sonnet-5-5
• Cohere:Embed 5 的共享向量空间与企业检索评估 https://cohere.com/blog/embed-5
• OpenAI:前沿 AI 训练 safety case 早期指南 https://openai.com/index/towards-safety-cases-for-frontier-ai-training
