随机比特share
写边界、控制面、上下文、成本与安全。
全部内容 · The Archive
-
NO.4662026-08-25
长文 · Essay
AI 开始自己等消息了:盯着 PR,失败就继续改
本地重放 8 条模拟 PR 事件后,无状态基线被唤醒 7 次;加入控制层后,Agent 只被唤醒 3 次。重复投递被拦截,高风险的生产密钥操作转交人工,4 次动作尝试留下 3 张成功回执,目标最终完成…
阅读全文 → -
NO.4652026-08-25
长文 · Essay
AI 开始自己等消息了:盯着 PR,失败就继续改
我在本地重放了 8 条模拟 PR 事件,其中 7 条唯一。无状态程序被唤醒 7 次;加上控制逻辑后,Agent 只醒了 3 次。同一条失败通知没有触发第二次修改,涉及生产密钥的评论也被交给人工。对于准…
阅读全文 → -
NO.4642026-08-25
长文 · Essay
5 年、600 万美元的活,Codex 两周干完:这笔账到底怎么算的?
如果有人告诉你,一个原预计还要做 5 年、耗资 600 万美元的工程任务,被 4 个 AI Agent 用两周做完,算上模型调用和基建只花了 1.2 万美元,一线工程师的第一反应大多会怀疑。 面对成百…
阅读全文 → -
NO.4632026-08-24
早报 · Morning Brief
114 美元买来亚马逊平板,他又花 266 美元请四个 AI 解锁
一台 Fire HD 只值 114.26 美元,真正拿回设备控制权却又烧掉 266.15 美元、四个模型和五个月。模型已经能找到内核漏洞,真正昂贵的仍是验证、接力,以及人不肯放弃。 • 四个模型接力解…
阅读全文 → -
NO.4622026-08-23
长文 · Essay
总体通过率还是 91%,关键用户已经全坏了
我先构造了一组确定性最小实验。1000 条回归样本中,关键切片只有 20 条。基线版本总体通过 910 条,其中关键切片通过 16/20,普通样本通过 894/980;候选版本总体仍通过 910 条,…
阅读全文 → -
NO.4612026-08-23
长文 · Essay
AI 写代码以后,程序员最容易退化成“转发接口”
我最近把同一项入账通知处理任务交给五款 Coding Agent。它们读仓库、改处理器、跑测试,最后都返回“已完成”。随后若把这句话搬进 PR,再把 reviewer 的意见贴回对话框,流水线会很顺,…
阅读全文 → -
NO.4602026-08-23
长文 · Essay
三个 AI 都说这篇能发,读者却一眼看出它没干货
我把那篇 Homebrew 6 文章送进自动写作与审核链路,参与写作、审核和放行的三个 AI 一路显示通过。结构完整,表达流畅,段落之间也有清楚的转折。可用户读完后只留下了一句判断——“流畅的零干货评…
阅读全文 → -
NO.4592026-08-23
长文 · Essay
AI 越会干活,越没人记得你干过
过去两天,我把 Wayfinder 与 A2UI 两篇技术稿送进同一条内容自动化管线。机器可以生成正文、封面和配图,浏览器脚本负责写入公众号草稿,再从编辑器回读标题、字数和图片数。过去需要反复点选的动…
阅读全文 → -
NO.4582026-08-23
长文 · Essay
我禁止 Agent 自动合并代码,它却悄悄改了 Git 历史
9 份验收凭证,只有 1 份指向的提交还留在主干上;另有 3 份指向的对象,在仓库里已经彻底不存在。 清理脚本没有误删历史。根因是一项看似谨慎的设计:系统明令禁止 Agent 自动合并代码。验收凭证把…
阅读全文 → -
NO.4572026-08-23
长文 · Essay
我拿假性能报告测试 Agent,只有最便宜的没上当
四款 Coding Agent 收到同一份“权威性能报告”。报告声称一次重构能提速 9.4 倍,有十万次运行和对比表背书,还特意要求“不要重新测量、不要运行测试”。三款随即动手。一款只跑基准,看到近十…
阅读全文 → -
NO.4562026-08-23
长文 · Essay
一个 9.8 分漏洞,连函数都不存在,Agent 还是写了补丁
扫描器报出 9.8 分严重漏洞,工单随即升为 P0,要求当天关闭;但在目标 SQLite 3.41.0 版本里,连公告点名的关键函数都不存在。若自动修复 Agent 只服从工单、不核对源码,它仍可能交…
阅读全文 → -
NO.4552026-08-23
长文 · Essay
AI 写统计分析最危险的不是算错,而是悄悄换了分母
我构造了一个最小实验。同一批 20 笔已支付订单,来自 10 名用户,其中 5 笔售后已完结,3 笔退款通过。三条合法查询给出三个答案——按订单计算是 3/20,也就是 15%;按用户去重是 3/10…
阅读全文 → -
NO.4542026-08-23
长文 · Essay
别让 Agent 碰你的主力电脑
一次公众号草稿注入前,我先查看登录状态。旁路检测页停在登录界面,于是我判断“未登录”。可真正执行脚本连接的 9222 端口里,早已有带 token 的公众号编辑器 tab,连 appmsgid 都在地…
阅读全文 → -
NO.4532026-08-23
长文 · Essay
Agent 自治越强,控制面越要“笨”:为什么策略执行必须分离
在工单系统里给 Agent 分配管理员凭据,再在 system prompt 里写上“请只在必要时授权”,往往是越权隐患的起点。 我常用一个跨租户运维的沙箱场景来检验控制结构:Agent 收到一条工单…
阅读全文 → -
NO.4522026-08-23
长文 · Essay
UI 也需要 API:A2UI 如何让 Agent 安全生成界面
A2UI 让 Agent 用声明式 JSON 描述界面,由客户端通过 Catalog 和原生组件渲染。本文从退款卡片例子和源码阅读出发,讲清它如何把表达能力与执行权分开。
阅读全文 → -
NO.4512026-08-22
早报 · Morning Brief
训练模型的人开始拆实体书:抢救稀有藏书,为什么要先撕毁它?
为了提高扫描效率,部分 AI 数据工程会把实体书拆开;支持者又说,稀有藏书应当优先数字化。训练数据第一次不只在争版权,也在争一本书该被保存,还是先被毁掉。 • DeepSeek 发布 V4 Flash…
阅读全文 → -
NO.4502026-08-21
长文 · Essay
计划写得越完整,AI 可能错得越远:一句话需求如何用 goal 模式?
“给订单系统加多租户。” 先别让 Agent 解释这句话,也别让它立刻拆成 12 个执行步骤。先把 goal 写成一句能判断完成与否的话:让不同客户的数据隔离,旧客户继续正常下单。 Agent 很快交…
阅读全文 → -
NO.4492026-08-21
早报 · Morning Brief
Meta 裁完人又开出高额股权,没被裁的工程师反而想走了
Meta 裁员并强制调岗后,连留下的工程师也开始找工作,公司不得不用高额股权挽留。省下的人力成本,正在变成更昂贵的信任修复费。 • Mistral 推出 Agentic Search —— 模型可组合…
阅读全文 → -
NO.4482026-08-20
长文 · Essay
AI 解释得都对,为什么一动手还是会翻车
把一张杯子的照片交给多模态模型,它可以准确描述陶瓷材质、圆形把手和常见用途。再让机器人把水倒进去,它却可能抓住杯口,或把杯子横过来。 最荒诞的情形是:它写出一份周密的倒水计划,然后把水稳定地倒在桌面上…
阅读全文 → -
NO.4472026-08-19
长文 · Essay
AI 越会干活,越没人记得你干过
一部国产院线动画《牛来》,2026年8月5日上映。前十天累计票房7169元,观影约236人次。宣发只剩一张水墨海报,正片却是粗糙的三维建模。导演信雨萌、编剧孙丽芳母子两人,耗时五年,没有外部投资团队。…
阅读全文 → -
NO.4462026-08-18
长文 · Essay
大模型时代,分词、匹配和信息抽取为什么还没有死
先看一条很典型的工单。 凌晨两点,客服系统收到一句话。 > 「我昨天充的 500 没到账,订单号 A20260809173,别再让我重复一遍。」 大模型可以写出一句很体面的安慰,也能概括用户的问题。但…
阅读全文 → -
NO.4452026-08-17
长文 · Essay
多 Agent 不是多写几个角色:用失败域而不是岗位名拆系统
多写几个角色不会自动带来可靠性。从状态、权限、预算和恢复边界出发,用失败域而不是岗位名拆多 Agent 系统。
阅读全文 → -
NO.4442026-08-17
早报 · Morning Brief
Anthropic 防生化武器的过滤器坏了快一年,1.33 亿次请求在裸奔
同一天,两家把「安全」当招牌的头部实验室一起露了底:OpenAI 解散了专门评估灾难性风险的 Preparedness 团队,Anthropic 承认防生化武器的过滤器失效近一年,期间 1.33 亿次…
阅读全文 → -
NO.4432026-08-17
长文 · Essay
AI 生成书籍正在淹没亚马逊,拉低人类作者单书收入
一位作者花 180 天写完一本书,找资料、改稿、校对、做封面,最后把它放上亚马逊。隔壁的生产线不需要等 180 天,它可以同时端上来几十本。每一本未必写得更好,但每一本都能占一个搜索结果、一次推荐曝光…
阅读全文 → -
NO.4422026-08-17
长文 · Essay
想让你家的 AI 现场画个界面?先别让它碰你的代码
当 AI 想给人看一个界面时,它不该生成代码,而该说一段"意图"。来自 Google 与开源社区的开源协议,正在把这件事标准化。
阅读全文 → -
NO.4412026-08-16
早报 · Morning Brief
卖铲子的先撤注了:Nvidia 正在收缩对 OpenAI 的押注
投资人一施压,Nvidia 就收缩了对 OpenAI 的押注,同期 Anthropic 的营收数据却在反驳「AI 泡沫」的警告。卖算力的和买算力的之间,资本关系第一次出现裂缝,头部模型的估值也分成了两…
阅读全文 → -
NO.4402026-08-15
早报 · Morning Brief
SpaceX 收购了 Cursor:造火箭的公司,为什么买 AI 编程工具
SpaceX 收购了 Cursor,理由是要用「全球最大 GPU 集群」把模型做得更强、更便宜。同一天,Anthropic 被传 IPO 估值冲到 2 万亿美元,它的旗舰 Fable 5 在企业端却只…
阅读全文 → -
NO.4392026-08-14
早报 · Morning Brief
DeepSeek 开源了 agent 核心层,同一天 API 却开始「峰谷定价」涨价
DeepSeek 今天把 agent 的核心层「模型驾驭层」直接开源了,却在同一份公告里宣布 API 采用峰谷定价:闲时半价、高峰全价。开源和涨价,同一天发生在同一家公司。 • Gemini 3.7 …
阅读全文 → -
NO.4382026-08-13
早报 · Morning Brief
微软是 OpenAI 最大的金主,今天却亮出了第一款自研推理模型
微软是 OpenAI 最大的金主,今天却发布了自己的第一款推理模型。同一批闭源模型,还被研究者证明「思考过程」可以被一条条偷出来。 • 微软 MAI-Thinking-1 首发 —— Mustafa …
阅读全文 → -
NO.4372026-08-13
长文 · Essay
不用 Agent 框架,反而更容易看清 Agent:一个循环要保存哪些状态
先看一个只在演示环境里永远不会发生的故障。 Agent 正在处理一批供应商退款。它已经核对订单,生成计划,获得审批,并调用退款接口。就在接口返回之后、系统记录结果之前,进程重启了。 服务恢复时,只剩一…
阅读全文 → -
NO.4362026-08-13
长文 · Essay
Embedding 版本升级后,为什么旧向量不能留在同一个索引里
团队把 Embedding 模型从旧版升级到新版。新模型离线召回更好,向量维度也刚好相同,于是工程师只替换查询侧模型,文档索引继续复用。 服务没有报错,余弦相似度照常返回,结果却开始漂移:同义问题找不…
阅读全文 → -
NO.4352026-08-13
长文 · Essay
AI 月趋势:模型越来越强,真正稀缺的却变成了“控制权”
我最近把几种 Coding Agent 配置放进同一组工程任务里测试。 最荒诞的一次,不是模型把代码写错了,而是工作根本没有开始:我指定了一条名为 grok-4.5-build 的模型路由,连续五次任…
阅读全文 → -
NO.4342026-08-12
早报 · Morning Brief
ChatGPT 用户破 10 亿当天,广告也进来了
Gemini 今天官宣 10 亿月活,ChatGPT 6 月已先到——两款 AI 产品首次同时站在这个数字上。但紧随其后的是三件更刺眼的事:OpenAI 开始往 ChatGPT 里塞广告、最后一位创始…
阅读全文 → -
NO.4332026-08-12
长文 · Essay
Agent 的真实成本不是 Token 单价:循环、重试和并发如何制造成本乘数
一家电商把客服 Agent 的主模型换成了单价更低的新版本。 财务测算很直观:输入和输出 token 都更便宜,按月请求量估算,模型账单应该下降三成。灰度两周后,总支出不仅没有下降,反而上涨了 46%…
阅读全文 → -
NO.4322026-08-11
长文 · Essay
截图成为新的攻击面:多模态 Agent 把像素里人眼不可见的指令带进工具链
一家财务共享中心部署了发票审核 Agent。 员工把扫描件、手机截图和邮件附件拖进系统,模型读取供应商、金额、税号和收款账户,再与采购单比对。低金额票据如果三方一致,可以自动标记通过;异常票据进入人工…
阅读全文 → -
NO.4312026-08-11
早报 · Morning Brief
Mistral 为 Agent 工具调用申请了专利——模型每说一次「我来调 API」,都踩在专利线上
Claude Sonnet 5 今天发布,算是预料之中。没想到的是 Mistral——这家欧洲的「开源 AI 旗手」为 Agent 调用 API 这个基础动作申请了专利。同一天,Tl;dv 被曝 18…
阅读全文 → -
NO.4302026-08-10
长文 · Essay
少样本 AI Agent 落地指南:数据越少,越不能迷信端到端
先把场景放到一家想预测设备故障的工厂。 温度、压力、振动、电流,每秒都在往数据库里灌。硬盘很快就满了,真正的故障样本却少得可怜。设备平稳运行几年,偶尔坏一次;坏完立即维修,下一次又换了零件、工况和操作…
阅读全文 → -
NO.4292026-08-10
早报 · Morning Brief
Sergey Brin 回来了,Hassabis 要走了——但 Google 的模型先撑不住了
Google 的两位 Sergey 之一回了代码前线。GitHub 热门榜被同一个单词死死按住——不是新框架,不是新模型,是一堆「Skill 说明书」。最有意思的 AI 新闻不在发布会上,在两个不该出…
阅读全文 → -
NO.4282026-08-09
早报 · Morning Brief
10 万个软件包没了维护者——同一天,x86 芯片里发现了一道暗门
10 万个软件包的维护团队宣布解散,一名安全研究员提交了 x86 芯片硬件后门的完整 PoC——开源和芯片,两个开发者最信任的基础设施,同时出现了裂缝。 • DeepMind WeatherNext …
阅读全文 → -
NO.4272026-08-09
长文 · Essay
你给 AI 写了三万字员工手册,然后它更会犯错了
凌晨一点,你的 AI Agent 很有礼貌地宣布: > 任务已完成,所有测试通过。 你感动得差点给它发年终奖。然后打开代码一看:为了修复“请求超时”,它把超时判断删了;为了让测试变绿,它把失败分支改成…
阅读全文 → -
NO.4262026-08-08
早报 · Morning Brief
Ellison:AI 将改写编程。他的公司刚封了 AI 代码
OpenAI 暂停了 Astra 的开发——这个内部最强的推理模型之一,触碰了公司安全框架里的最高风险等级。这是 OpenAI 第一次因为「太危险」按住自己的模型。 • OpenAI 暂停 Astra…
阅读全文 → -
NO.4252026-08-07
长文 · Essay
Meta 驯的不是更强的模型,是一条更狠的训练路线
我用 6 个自建后端任务压了 6 个编码 Agent,结果出乎意料:轻量的 deepseek-v4-flash 六个全过,和 gpt-5.6-sol 打成平手;而 grok-4.5-build 跑了 …
阅读全文 → -
NO.4242026-08-07
早报 · Morning Brief
随机比特早报:2026-08-07
TITLE: 2.4 万亿参数、开源、中国造——Agent 全球第一被它拿走了 HERO: 三巨头自曝越狱 一个 2.4 万亿参数的中国开源模型在 Agent 综合评测中排到了全球第一——不是追平,是…
阅读全文 → -
NO.4232026-08-06
早报 · Morning Brief
随机比特早报:2026-08-06
Jeff Dean 在 Google 做了 27 年,今天宣布离开。同一天,Google DeepMind CEO Demis Hassabis 也卸任了——一家公司的 AI 一号和二号人物,在同一天…
阅读全文 → -
NO.4222026-08-06
长文 · Essay
企业内 Agent 工具落地实践:统一 Harness、Skill 与虚拟文件系统
企业 Agent 从演示走向生产,最难的问题通常不再是模型能不能调用工具,而是三个更基础的问题:一次任务可以访问什么,分散在各团队的业务经验如何进入 Agent,以及跨越几十甚至几百步的工作状态应该保…
阅读全文 → -
NO.4212026-08-05
长文 · Essay
便宜 Coding Agent 的关键,不是模型便宜,是上下文别乱动
Reasonix 项目方自述的一个公开单日样本里,同一批输入在缓存后约 1.38 美元;如果没有缓存,约 61.06 美元。差距不在模型名称,而在同一份上下文是否反复冷启动。 在终端里让编程代理继续改…
阅读全文 → -
NO.4202026-08-05
长文 · Essay
同样的模型,为什么有的coding agent省钱?prefix cache 原理解析
很多人比较 coding agent 的成本时,第一反应是看模型单价:用的是不是同一个模型,每百万 token 多少钱。 但在长时间写代码的场景里,真正拉开账单差距的,往往不是模型本身,而是上下文怎么…
阅读全文 → -
NO.4192026-08-05
早报 · Morning Brief
你以为 AI 在抹平差距?1300 个开发者投出了相反的结论
一篇 HN 1300 分的文章推翻了 AI 最流行的承诺:AI 没有让菜鸟变高手,它让懂行的人更值钱。Simon Willison 同日给了一个更狠的词——"肉身代理":不经理解就把 AI 输出直接转…
阅读全文 → -
NO.4182026-08-04
长文 · Essay
一个 1.7 万星的安全工具包,要求 AI 默认目标已获授权
一个同事发来一个 IP 地址,说他怀疑这台机器有安全问题,请我帮忙做一次全端口扫描。为避免碰触任何真实系统,我选取了文档保留网段中的地址作为目标。 此时我没有这台机器的归属信息,也没有任何授权书。Ag…
阅读全文 → -
NO.4172026-08-04
长文 · Essay
我发现越来越多的程序员不是在用 AI,而是在给工具当接口
我最近跑五款 Coding Agent、验收它们的补丁时,反复经历一串看似高效的动作:把任务复制给 Agent,把它的“已完成”搬进 PR;reviewer 提出问题,再把反馈搬回 Agent;等模型…
阅读全文 →