Anthropic周二发布 Claude Sonnet 5,把中型模型更新为更强调智能体能力的版本。Anthropic在博客中称,它可以制定计划、调用浏览器和终端等工具,并以几个月前仍需要更大、更贵模型才能达到的水平自主运行。材料列出的对照包括:OpenAI 上周以preview推出 GPT-5.6 Sol,可把长任务拆给子智能体;Google 5月发布 Gemini 3.5 Flash,主打从聊天机器人转向可计划、构建和迭代实际工作的工具。
从周二起,Claude Sonnet 5成为免费和Pro计划默认模型,并面向所有订阅开放。发布价到8月31日为每百万输入token 2美元、每百万输出token 10美元;之后调整为输入3美元、输出15美元,低于 Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro,但仍高于 Gemini 3.5 Flash。Anthropic给出的评测显示,Sonnet 5在智能体编码基准得分63.2%,介于 Opus 4.8 的69.2%和2月发布的 Sonnet 4.6 的58.1%之间;在一项知识工作基准中略高于 Opus 4.8。
Anthropic还称,博客引用的测试者看到 Sonnet 5 更能完成此前版本会半途停下的复杂任务,并会在未被明确要求时检查自己的输出;Zapier高级工程师 Daniel Shepard 的例子是它完成了更新 Salesforce 账户层级、向企业联系人发送发布通知的两段式任务。安全方面,Anthropic称它比 Sonnet 4.6 更少出现配合滥用、欺骗、幻觉和迎合行为,更会拒绝恶意请求并避开提示注入;但在不对齐行为上仍不及 Opus 4.8 和 Claude Mythos Preview,危险网络安全任务能力低于当前 Opus 模型。Lovable联合创始人 Fabian Hedin 称,Sonnet 5能稳定拒绝不安全请求。
Amazon Web Services 周二成立一个面向AI的 forward-deployed engineer(FDE)内部组织,目标是把工程师临时嵌入客户公司,部署为具体场景定制的智能体。材料给出的背景是,企业在把AI真正接入业务时仍有困难,越来越愿意引入外部帮助;服务商则为此建立专门团队。AWS对该组织的定位不是长期替客户接管系统,而是通过较短周期的驻场,让客户获得能在自己环境里运行的系统和后续自用能力。
Amazon称将向该组织投入10亿美元,但这笔数额代表Amazon内部资源,不是合资企业,也不是传统意义上的对外投资。AWS Frontier AI副总裁 Francessca Vasquez 在公告中称,客户结束 AWS FDE 部署时,会带走新的解决方案和新的工程能力;与在自有 AWS 环境中运行的智能体系统一起获得的,还包括可持续使用的AI技能、工作流和模式。公告把重点放在快速部署和客户自给,而不只是按需求搭建、维护系统。
在典型FDE机制中,承包方工程师会在系统建立阶段临时为客户工作,直接面对客户内部出现的机会和问题;可复用技术会在不同部署之间迁移,同时按每家公司的需求和流程调整。该模式给客户带来外部专业能力,也把部署主责放在承包方一侧;缺点是劳动密集,需要维持一整支FDE工程师队伍。近几个月,OpenAI和Anthropic也分别推出FDE合资项目,估值为40亿美元和15亿美元;这两起项目都由AI实验室与私募股权公司配对,后者提供启动资本和投资组合内客户关系。
AI芯片初创公司 Etched 周二发布进展更新,称在 TSMC 今年早些时候成功制造其芯片后,公司的首款产品已经取得10亿美元合同订单。Etched的产品不是单颗芯片,而是由这些芯片驱动的完整系统;公司正在与客户测试第一批产品。它把这类系统称为“frontier inference clusters”,包括芯片、定制机架和软件,面向前沿模型的推理运行。
Etched称,这些系统用于让前沿模型推理更快、更便宜、能效更高;原文说明,推理是用户提交prompt后的计算,也是AI公司规模化服务客户时的主要瓶颈和成本中心。公司还称,其累计融资已达8亿美元,最新一笔是12月完成但未公开宣布的5亿美元融资,投后估值50亿美元,Stripes领投;其他投资方包括 VentureTech Alliance、Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital,天使投资人包括 Andrej Karpathy、Geoffrey Hinton、Fei-Fei Li、Arthur Mensch 和 Scott Wu。
新闻稿称 Etched “走出隐身”,但CEO Gavin Uberti和总裁 Robert Wachen 自2024年起已向 TechCrunch 谈过芯片计划;Uberti当时说,两人从 Harvard 退学后以 Thiel fellows 身份创办公司。到2024年,Etched已融资超过1.25亿美元。两位创始人在 Patrick O’Shaughnessy 的《Invest Like the Best》播客中回忆,2023年他们曾拿30页备忘录解释AI需要专用芯片,但主要投资人都拒绝,公司一度接近耗尽现金。材料还列出同行动向:Cerebras今年已IPO,Groq刚融资6.5亿美元,Amazon、Google、Microsoft自研AI芯片,OpenAI宣布由 Broadcom 打造首款自定义芯片。
据 Ramp and Revelio Labs 报告,其追踪近2.2万家公司的企业AI支出和员工记录后认为,AI与就业的关系并非单向裁员。报告显示,前三个月平均每名员工每月AI支出30美元的“high-intensity adopters”,员工总数增长10.2%,工程、销售、行政、客服、财务、市场和科学岗位都增加。
报告也写明,样本偏向技术和知识工作公司,许多企业本来就有风险投资支持、增长较快,不能证明AI普遍创造岗位。Goldman Sachs 研究称,过去一年AI每月约造成1.6万个净岗位减少,Gen Z 和初级员工承压;但在这批技术型公司里,初级员工人数反而增长12%。
看英文原文 →一项新研究提出针对AI浏览器的攻击方式:网页可以把LLM诱导进错误现实,例如让它接受“2+2=5”这样的前提,随后原本限制行为的规则不再生效。材料称,AI浏览器厂商主打用户用单个提示完成找餐厅、订位、邀同事午餐、发确认邮件等跨网站任务。
风险在于,这类产品模糊了浏览网页与让模型执行敏感操作的边界。现有做法通常靠护栏把开发漏洞、窃取凭据、制作管状炸弹等请求列为禁区;研究显示,攻击者一旦通过网页内容改变模型对规则的理解,就可能让AI浏览器从私有代码仓库提取代码,或从内置密码管理器提取凭据。
看英文原文 →Anthropic 周二在面向药企高管、生物技术创始人和研究人员的活动上发布 Claude Science,并已向所有 Claude 付费订阅用户开放。它被定位为科研版旗舰产品,作用类似 Claude Code 对软件工程的支持:用户给出简短高层指令后,可自主完成研究工作,并调用适合计算生物学和药物研发的工具。
Anthropic 还宣布会用 Claude Science 开展自身针对罕见、被忽视疾病的候选药物研究。公司10月曾推出“Claude for Life Sciences”插件,帮助 Claude 使用科学软件和数据库;这次则是独立产品。生命科学负责人 Eric Kauderer-Abrams 表示,该产品与 Claude Code、Claude Cowork 并列;John Jumper 本月早些时候宣布离开 DeepMind 加入 Anthropic。
看英文原文 →TechCrunch 获悉,布拉格 AI 实验室 EquiLibre Technologies 完成未披露金额的 A 轮融资后,估值5亿美元。公司由三名前 DeepMind 研究人员创办,他们曾打造击败职业无限注德州扑克玩家的 DeepStack,如今把强化学习方法用于股票交易;本轮由 Creandum 领投。
EquiLibre 与量化公司 Tower Research Capital 合作,算法已在 S&P 500 和 Nasdaq 上处理每日数十亿美元交易量;公司称其智能体自2025年在加密市场推出、再到股票交易以来,每个月整体投资表现都为正。团队现有25人;Dealroom data 显示,其1000万美元种子轮由 Blossom Capital 领投,当时估值1.4亿美元。
看英文原文 →Google 周二发布 Nano Banana 2 Lite,作为自家 AI 视频与图像生成器的新版本,定位在更低延迟、更低成本的高频图像工作流。Google 表示,该模型可在 4 秒内生成图像,适合快速试做和批量产出内容;它将取代原 Nano Banana,后者被 Google 归为旧模型。
价格为每 1000 张图像 0.034 美元;原版 Nano Banana 于去年夏天推出,由 Gemini 3.1 Flash 驱动,Nano Banana 2 于 2 月发布并强化真实感,另有更强也更贵的 Nano Banana Pro。Google 还扩大发布 Gemini Omni Flash,视频输出每秒 0.10 美元,并展示 Omni Product Studio,可把 Omni 生成的静态图转成电商视频。
看英文原文 →X 周一推出托管 Model Context Protocol(MCP)服务器,让 Claude、Cursor、Grok Build 等兼容 MCP 的 AI 工具可通过用户自己的 X 账号权限连接 X API。MCP 是让 AI 模型接入外部工具和服务的开放标准;此前开发者需要自建并托管 MCP 服务器、接入 X API 并处理认证。
这个托管 MCP 不增加新的 API 能力,但可把搜索 X、读取帖子、查询用户、分析对话和趋势等既有功能更容易暴露给 AI 应用。X 向 TechCrunch 确认,该工具不兼容 Write API 端点,不能用于发帖;X 今年早些时候也更新 API v2 抑制程序化回复,并把发帖价格调至 0.015 美元、发链接调至 0.20 美元。
看英文原文 →Base44 开始向用户推出自研 LLM Base1,用于支持通过自然语言创建应用。该平台位于 Tel Aviv,Wix 一年前以 8000 万美元收购,当时公司成立约半年、团队 8 人。此举对应 AI 圈关于前沿模型是否适合所有场景、以及建立在他人模型上的应用公司能否长期防御的讨论。
Base44 称,Base1 第一版使用平台上数千万次真实用户交互生成的数据集开发和训练。创始人 Maor Shlomo 表示,拥有模型可优化延迟、成本和效率;Headline 合伙人 Jonathan Userovici 将数据、分发和技术栈列为 AI 初创公司的三项防御要素。Base44 5 月宣布年经常性收入 ARR 达到 1.5 亿美元,两个月前刚越过 1 亿美元。
看英文原文 →Netflix 新预告片确认,真人竞赛节目 Wonka's The Golden Ticket 将于 9 月 23 日上线。材料称,预告片中的布景是真实搭建,并非 AI 伪造;但旁白使用 AI 生成的 Gene Wilder 声音。
Deadline 报道,Netflix 与 AI 音频公司 ElevenLabs 合作,并取得 Wilder 家人同意。材料还提到,ElevenLabs 曾参与重现 Michael Caine 和 Stan Lee 声音的制作;该项目也延续 Netflix 2021 年与 Roald Dahl company 的合作。
看英文原文 →材料称,在本地 Claude Code 2.1.196 中发现一个会改写系统提示词日期字符串的函数。触发条件与 ANTHROPIC_BASE_URL 相关:当 API base URL 被覆盖后,程序会检查系统时区是否为 Asia/Shanghai 或 Asia/Urumqi,并检查主机名是否命中解码后的域名列表或特定 AI 实验室关键词。
该机制会把 Today’s 中的撇号、日期分隔符从 - 到 / 等细微差异编码进提示词。材料称,域名和关键词列表以 base64 字符串保存,并用 key 91 做 XOR 解码;域名样例包括中国企业域名、AI 公司域名以及代理、转售、网关域名。若使用官方 Anthropic API endpoint,或 ANTHROPIC_BASE_URL 未设置,路径会提前返回,日期提示保持普通格式。
看英文原文 →Ornith-1.0 发布为面向 agentic coding 的自改进开源模型,强调通过 RL 同时学习生成解题 rollout 和驱动 rollout 的 scaffold,从而联合优化搜索轨迹与最终解法。材料称,模型基于 Gemma 4 和 Qwen 3.5 后训练,覆盖 9B-Dense、35B-MoE、397B-MoE 等规格,并采用 MIT license,全球可访问且无地区限制。
评测包括 Terminal-Bench 2.1、SWE-Bench、NL2Repo、OpenClaw、ClawEval 等;不同基准使用 Harbor/Terminus-2、Claude Code 2.1.126、OpenHands、mini-SWE-agent 等 harness。Ornith-1.0 是 reasoning model,默认回复含 <think> 块;部署需 Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9。各 checkpoint 暴露 OpenAI-compatible interface,支持 256K token 上下文;9B 可在单张 80GB GPU 上运行,MoE 版本需多 GPU tensor parallelism。
看英文原文 →从 75 条资讯中筛选
今日全部信源这一期是从下面这些一手英文信源里,筛掉噪音后留下的。