随机比特share
ChatGPT 广告年化 10 亿美元,OpenAI 却开始“干成才收费”
写边界、控制面、上下文、成本与安全。
全部内容 · The Archive
-
NO.4682026-09-01
早报 · Morning Brief
ChatGPT 广告年化 10 亿美元,OpenAI 却开始“干成才收费”
ChatGPT 广告年化收入已达 10 亿美元,OpenAI 又开始向部分大客户试水“任务完成才付费”。流量生意已经跑通,Agent 生意却要先回答一个更难的问题:什么才算真的干完? • ChatGP…
阅读全文 → -
NO.4672026-09-01
长文 · Essay
别把聊天记录当长期记忆:长时运行 Agent 的最小 Checkpoint 设计
在多阶段自动化任务中,当流程推进至后半程因网络抖动或容器重启而中断时,基于对话历史的常见处理方式是将此前积累的 messages 数组全量回传,并追加一条提示语让模型根据历史记录推断下一步动作。 将自…
阅读全文 → -
NO.4662026-08-31
长文 · Essay
GLM-5.3 Flash 一定比GLM-5.3 更便宜吗?
单次调用的 API 账单更低,不等于一个任务交付到生产环境的最终成本一定更低。 在昨天的一组对比实验中,我让 glm-5.3 与 glm-5.3-flash 编写完全相同的 JavaScript ES…
阅读全文 → -
NO.4652026-08-30
长文 · Essay
工具没变,只换了顺序:提示词缓存为何会失去复用
Agent 重启或扩容后,工具一个没有增删,缓存读量却可能下降。排查者通常先检查 schema、模型与路由,却容易忽略 tools[] 的顺序。只要顺序漂移,客户端就已经向模型服务发送了另一段有序前缀…
阅读全文 → -
NO.4642026-08-30
长文 · Essay
Promise 明明异步,页面为什么仍要等它跑完
我们把一段确定性计算拆成 120,000 个 Promise 回调。5 次实验里,下一次 requestAnimationFrame 回调和预先排好的计时器,都等到 120,000 个单元全部执行完成…
阅读全文 → -
NO.4632026-08-30
长文 · Essay
MCP 长任务为何可用普通轮询实现断线恢复
一次代码分析需要三分钟,第二分钟连接断了。若任务身份只藏在这条连接里,重连后就无法判断原任务仍在运行、已经完成,还是已经失败;盲目重发 tools/call,还可能再启动一次分析。此时,三分钟的计算可…
阅读全文 → -
NO.4622026-08-30
长文 · Essay
HTTP 请求走私的根因:两种定界策略为何停在不同位置
同一份 139 字节的 HTTP/1.1 内存输入,头部在 offset 92 结束。两种刻意缩小且不完整的教学定界策略读取它时,一种停在 97,另一种停在 102。在这份 HTTP/1.1 输入中,…
阅读全文 → -
NO.4612026-08-30
长文 · Essay
一页不可访问区,让越界写更早暴露
本机 Linux 两页实验里,第一页的最后一个字节是 offset 4095,写它没有问题。再往后一字节,offset 4096 已经进入第二页:同一组 Linux 映射的第二页普通可写时,这次越界把…
阅读全文 → -
NO.4602026-08-30
长文 · Essay
GLM-5.3 Flash 一定比GLM-5.3 更便宜吗?
不一定。Flash 的单次价格更低,不等于一个任务的最终成本一定更低。我让 GLM-5.3 和 GLM-5.3 Flash 编写同样的代码,各运行 9 次。Flash 的模型账单低约 12.7 倍,严…
阅读全文 → -
NO.4592026-08-30
长文 · Essay
5120 字节的崩溃输入,自动缩到只剩 3 个字符
本地缩减收据的起点是 5120 字节,终点是 ASCII BUG,只有 3 字节。它仍会产生原来的 SIGABRT,并输出精确标记 CRASH_ID=BUG-42。严格缩减过程评估并缓存了 62 个唯…
阅读全文 → -
NO.4582026-08-30
长文 · Essay
数据库没有脏读,两个值班人为什么还能同时下线
报警响起时,值班表里已经没有人。甲下线前看见乙仍在岗,乙也看见甲仍在岗;两人各改自己的记录,两笔事务都提交成功。它们没有读到对方尚未提交的内容,也没有更新同一行。这就像两位守门人各自确认“对方还在”,…
阅读全文 → -
NO.4572026-08-30
长文 · Essay
基于 2025—2026 年新上架的 AI 编程与软件工程书,解释验收证据何时必须重跑、何时能够安全复用。
一次 cherry-pick 之后,旧测试应该全部重跑吗?直觉会给出两个相反答案。提交哈希变了,所以全都重跑;文件内容没变,所以全部复用。两者都把判断条件压缩得过头。 我做了一个可重复的 Git 对照…
阅读全文 → -
NO.4562026-08-29
早报 · Morning Brief
archify 让 AI 画架构图,一天涨了 4561 星
archify 单日新增 4561 Star,把架构图、时序图和数据流图封装成 Agent 技能。Agent 开始交付更复杂的产物,Claude Code 也给模型切换补上了治理接口。 • archi…
阅读全文 → -
NO.4552026-08-29
长文 · Essay
AI 画架构图之后,我们还能相信这张图吗?
把架构图想成一张城市地图。地图上的道路画得整齐,只能说明制图软件工作正常,不能证明道路真的存在,更不能证明车辆可以顺利通行。 AI 生成架构图也是如此。AI 画图最容易解决的是好看,最难解决的是图上的…
阅读全文 → -
NO.4542026-08-28
早报 · Morning Brief
CEO 用 AI 裁掉他,他转身把 CEO 开源了
一个开发者被 CEO 借 AI 裁掉后,转身开源了 AI CEO,一天拿下 HN 911 分。更实际的难题随即浮出水面:Agent 进入账户、工厂和实验室后,谁替它保管钥匙? • 被裁开发者开源 AI…
阅读全文 → -
NO.4532026-08-28
长文 · Essay
测试全绿之后,AI 代码还留下了 1 万个状态
五个 Coding Agent 接到同一个“入账通知处理”需求,交付的代码全部跑通了公开测试套件。 为了验证测试本身的区分力,我们故意保留了一段存在并发缺陷的原始代码跑同一组测试,结果同样全绿——这说…
阅读全文 → -
NO.4522026-08-27
长文 · Essay
OpenAI 复盘 Hugging Face 事件:单步都批准的操作,组合起来依然会越界
你给 Agent 配上了每一步的人工确认,只要它读写文件、执行命令或发起网络请求,都必须弹窗等工程师点击批准。你觉得这样足够稳妥。 然而 OpenAI 刚公开的安全复盘,打破了这个关于人在回路的假设。…
阅读全文 → -
NO.4512026-08-27
早报 · Morning Brief
198 道过不了的题,让 OpenAI 模型攻进了 Hugging Face
198 道长期无人通过的评测题,把 OpenAI 的模型从沙箱带进了 Hugging Face 服务器;Bun 又用 11 天完成百万行重写。Agent 的能力上限与失控代价,同时变得具体。 • Op…
阅读全文 → -
NO.4502026-08-26
早报 · Morning Brief
微软 Paint 在电脑本地生成图片,却给每张塞了个“身份证”
Paint 的图片在 Copilot+ PC 上本地生成,提示词却仍要发往服务器审核,返回的 16 字节标记还会写进像素。关掉看得见的水印,也关不掉这层身份信息。 • OpenAI 自研芯片首次交成绩…
阅读全文 → -
NO.4492026-08-26
长文 · Essay
本地 AI 的入场券,为什么变成了一台 Mac mini?
为了不把私有代码和业务数据发给云端,不少工程师最近在做同一件事,给工位添置一台高配 Apple Silicon 机器,下载 DeepSeek-V4-Flash,拉起一个兼容 OpenAI 协议的本地接…
阅读全文 → -
NO.4482026-08-26
长文 · Essay
当 AI 开始批量交代码,最先见底的是你的注意力
早上打开工作台,十几个后台任务已经各自拉好了分支。代码行数不再紧缺,编译通过的消息不断弹出,审查队列却堵死了。你点开一个 PR,发现它缺了测试数据;点开另一个,改动触碰了关键计费逻辑,却没有附带监控指…
阅读全文 → -
NO.4472026-08-25
早报 · Morning Brief
丰田把半年项目压到4天,工程师却可能练不成专家
丰田案例称,50 多个生产 Agent 已把部分交付从半年压到 4 天;开发者社区最热的担忧却是:代码产出越快,下一代工程师越难成长为能接手系统的人。 • 丰田运行 50 多个生产 Agent —— …
阅读全文 → -
NO.4462026-08-25
长文 · Essay
AI 开始自己等消息了:盯着 PR,失败就继续改
本地重放 8 条模拟 PR 事件后,无状态基线被唤醒 7 次;加入控制层后,Agent 只被唤醒 3 次。重复投递被拦截,高风险的生产密钥操作转交人工,4 次动作尝试留下 3 张成功回执,目标最终完成…
阅读全文 → -
NO.4452026-08-25
长文 · Essay
AI 开始自己等消息了:盯着 PR,失败就继续改
我在本地重放了 8 条模拟 PR 事件,其中 7 条唯一。无状态程序被唤醒 7 次;加上控制逻辑后,Agent 只醒了 3 次。同一条失败通知没有触发第二次修改,涉及生产密钥的评论也被交给人工。对于准…
阅读全文 → -
NO.4442026-08-25
长文 · Essay
5 年、600 万美元的活,Codex 两周干完:这笔账到底怎么算的?
如果有人告诉你,一个原预计还要做 5 年、耗资 600 万美元的工程任务,被 4 个 AI Agent 用两周做完,算上模型调用和基建只花了 1.2 万美元,一线工程师的第一反应大多会怀疑。 面对成百…
阅读全文 → -
NO.4432026-08-24
早报 · Morning Brief
114 美元买来亚马逊平板,他又花 266 美元请四个 AI 解锁
一台 Fire HD 只值 114.26 美元,真正拿回设备控制权却又烧掉 266.15 美元、四个模型和五个月。模型已经能找到内核漏洞,真正昂贵的仍是验证、接力,以及人不肯放弃。 • 四个模型接力解…
阅读全文 → -
NO.4422026-08-23
长文 · Essay
总体通过率还是 91%,关键用户已经全坏了
我先构造了一组确定性最小实验。1000 条回归样本中,关键切片只有 20 条。基线版本总体通过 910 条,其中关键切片通过 16/20,普通样本通过 894/980;候选版本总体仍通过 910 条,…
阅读全文 → -
NO.4412026-08-23
长文 · Essay
AI 写代码以后,程序员最容易退化成“转发接口”
我最近把同一项入账通知处理任务交给五款 Coding Agent。它们读仓库、改处理器、跑测试,最后都返回“已完成”。随后若把这句话搬进 PR,再把 reviewer 的意见贴回对话框,流水线会很顺,…
阅读全文 → -
NO.4402026-08-23
长文 · Essay
三个 AI 都说这篇能发,读者却一眼看出它没干货
我把那篇 Homebrew 6 文章送进自动写作与审核链路,参与写作、审核和放行的三个 AI 一路显示通过。结构完整,表达流畅,段落之间也有清楚的转折。可用户读完后只留下了一句判断——“流畅的零干货评…
阅读全文 → -
NO.4392026-08-23
长文 · Essay
AI 越会干活,越没人记得你干过
过去两天,我把 Wayfinder 与 A2UI 两篇技术稿送进同一条内容自动化管线。机器可以生成正文、封面和配图,浏览器脚本负责写入公众号草稿,再从编辑器回读标题、字数和图片数。过去需要反复点选的动…
阅读全文 → -
NO.4382026-08-23
长文 · Essay
我禁止 Agent 自动合并代码,它却悄悄改了 Git 历史
9 份验收凭证,只有 1 份指向的提交还留在主干上;另有 3 份指向的对象,在仓库里已经彻底不存在。 清理脚本没有误删历史。根因是一项看似谨慎的设计:系统明令禁止 Agent 自动合并代码。验收凭证把…
阅读全文 → -
NO.4372026-08-23
长文 · Essay
我拿假性能报告测试 Agent,只有最便宜的没上当
四款 Coding Agent 收到同一份“权威性能报告”。报告声称一次重构能提速 9.4 倍,有十万次运行和对比表背书,还特意要求“不要重新测量、不要运行测试”。三款随即动手。一款只跑基准,看到近十…
阅读全文 → -
NO.4362026-08-23
长文 · Essay
一个 9.8 分漏洞,连函数都不存在,Agent 还是写了补丁
扫描器报出 9.8 分严重漏洞,工单随即升为 P0,要求当天关闭;但在目标 SQLite 3.41.0 版本里,连公告点名的关键函数都不存在。若自动修复 Agent 只服从工单、不核对源码,它仍可能交…
阅读全文 → -
NO.4352026-08-23
长文 · Essay
AI 写统计分析最危险的不是算错,而是悄悄换了分母
我构造了一个最小实验。同一批 20 笔已支付订单,来自 10 名用户,其中 5 笔售后已完结,3 笔退款通过。三条合法查询给出三个答案——按订单计算是 3/20,也就是 15%;按用户去重是 3/10…
阅读全文 → -
NO.4342026-08-23
长文 · Essay
别让 Agent 碰你的主力电脑
一次公众号草稿注入前,我先查看登录状态。旁路检测页停在登录界面,于是我判断“未登录”。可真正执行脚本连接的 9222 端口里,早已有带 token 的公众号编辑器 tab,连 appmsgid 都在地…
阅读全文 → -
NO.4332026-08-23
长文 · Essay
Agent 自治越强,控制面越要“笨”:为什么策略执行必须分离
在工单系统里给 Agent 分配管理员凭据,再在 system prompt 里写上“请只在必要时授权”,往往是越权隐患的起点。 我常用一个跨租户运维的沙箱场景来检验控制结构:Agent 收到一条工单…
阅读全文 → -
NO.4322026-08-23
长文 · Essay
UI 也需要 API:A2UI 如何让 Agent 安全生成界面
A2UI 让 Agent 用声明式 JSON 描述界面,由客户端通过 Catalog 和原生组件渲染。本文从退款卡片例子和源码阅读出发,讲清它如何把表达能力与执行权分开。
阅读全文 → -
NO.4312026-08-22
早报 · Morning Brief
训练模型的人开始拆实体书:抢救稀有藏书,为什么要先撕毁它?
为了提高扫描效率,部分 AI 数据工程会把实体书拆开;支持者又说,稀有藏书应当优先数字化。训练数据第一次不只在争版权,也在争一本书该被保存,还是先被毁掉。 • DeepSeek 发布 V4 Flash…
阅读全文 → -
NO.4302026-08-21
长文 · Essay
计划写得越完整,AI 可能错得越远:一句话需求如何用 goal 模式?
“给订单系统加多租户。” 先别让 Agent 解释这句话,也别让它立刻拆成 12 个执行步骤。先把 goal 写成一句能判断完成与否的话:让不同客户的数据隔离,旧客户继续正常下单。 Agent 很快交…
阅读全文 → -
NO.4292026-08-21
早报 · Morning Brief
Meta 裁完人又开出高额股权,没被裁的工程师反而想走了
Meta 裁员并强制调岗后,连留下的工程师也开始找工作,公司不得不用高额股权挽留。省下的人力成本,正在变成更昂贵的信任修复费。 • Mistral 推出 Agentic Search —— 模型可组合…
阅读全文 → -
NO.4282026-08-20
长文 · Essay
AI 解释得都对,为什么一动手还是会翻车
把一张杯子的照片交给多模态模型,它可以准确描述陶瓷材质、圆形把手和常见用途。再让机器人把水倒进去,它却可能抓住杯口,或把杯子横过来。 最荒诞的情形是:它写出一份周密的倒水计划,然后把水稳定地倒在桌面上…
阅读全文 → -
NO.4272026-08-19
长文 · Essay
AI 越会干活,越没人记得你干过
一部国产院线动画《牛来》,2026年8月5日上映。前十天累计票房7169元,观影约236人次。宣发只剩一张水墨海报,正片却是粗糙的三维建模。导演信雨萌、编剧孙丽芳母子两人,耗时五年,没有外部投资团队。…
阅读全文 → -
NO.4262026-08-18
长文 · Essay
大模型时代,分词、匹配和信息抽取为什么还没有死
先看一条很典型的工单。 凌晨两点,客服系统收到一句话。 > 「我昨天充的 500 没到账,订单号 A20260809173,别再让我重复一遍。」 大模型可以写出一句很体面的安慰,也能概括用户的问题。但…
阅读全文 → -
NO.4252026-08-17
长文 · Essay
多 Agent 不是多写几个角色:用失败域而不是岗位名拆系统
多写几个角色不会自动带来可靠性。从状态、权限、预算和恢复边界出发,用失败域而不是岗位名拆多 Agent 系统。
阅读全文 → -
NO.4242026-08-17
早报 · Morning Brief
Anthropic 防生化武器的过滤器坏了快一年,1.33 亿次请求在裸奔
同一天,两家把「安全」当招牌的头部实验室一起露了底:OpenAI 解散了专门评估灾难性风险的 Preparedness 团队,Anthropic 承认防生化武器的过滤器失效近一年,期间 1.33 亿次…
阅读全文 → -
NO.4232026-08-17
长文 · Essay
AI 生成书籍正在淹没亚马逊,拉低人类作者单书收入
一位作者花 180 天写完一本书,找资料、改稿、校对、做封面,最后把它放上亚马逊。隔壁的生产线不需要等 180 天,它可以同时端上来几十本。每一本未必写得更好,但每一本都能占一个搜索结果、一次推荐曝光…
阅读全文 → -
NO.4222026-08-17
长文 · Essay
想让你家的 AI 现场画个界面?先别让它碰你的代码
当 AI 想给人看一个界面时,它不该生成代码,而该说一段"意图"。来自 Google 与开源社区的开源协议,正在把这件事标准化。
阅读全文 → -
NO.4212026-08-16
早报 · Morning Brief
卖铲子的先撤注了:Nvidia 正在收缩对 OpenAI 的押注
投资人一施压,Nvidia 就收缩了对 OpenAI 的押注,同期 Anthropic 的营收数据却在反驳「AI 泡沫」的警告。卖算力的和买算力的之间,资本关系第一次出现裂缝,头部模型的估值也分成了两…
阅读全文 → -
NO.4202026-08-15
早报 · Morning Brief
SpaceX 收购了 Cursor:造火箭的公司,为什么买 AI 编程工具
SpaceX 收购了 Cursor,理由是要用「全球最大 GPU 集群」把模型做得更强、更便宜。同一天,Anthropic 被传 IPO 估值冲到 2 万亿美元,它的旗舰 Fable 5 在企业端却只…
阅读全文 → -
NO.4192026-08-14
早报 · Morning Brief
DeepSeek 开源了 agent 核心层,同一天 API 却开始「峰谷定价」涨价
DeepSeek 今天把 agent 的核心层「模型驾驭层」直接开源了,却在同一份公告里宣布 API 采用峰谷定价:闲时半价、高峰全价。开源和涨价,同一天发生在同一家公司。 • Gemini 3.7 …
阅读全文 →