OpenAI 的 GPT-5.6 约两周前卷入监管风波:在 limited preview 阶段,模型只向政府批准的组织开放。材料显示,OpenAI 已获得 Trump 政府对公开推出 GPT-5.6 的 greenlight,并把同一天作为新产品发布节点。OpenAI CEO Sam Altman 将 GPT-5.6 形容为「我们迄今生产过的最佳模型」。
这次材料给出的时间和产品口径很清楚:从 limited preview 到 public rollout,间隔约两周;同日亮相的 ChatGPT Work 被描述为 ChatGPT 与 Codex 的结合。它面向 everyday non-technical user,让非技术用户也能把 Codex 能力用在非编程任务上,而不是只把 Codex 放在代码场景里。
ChatGPT Work 的底层模型写明为 GPT-5.6 model suite,包含 Sol、Terra 和 Luna。材料还把该产品的定位落在「非编码任务」上:普通非技术用户使用的不是单独的 Codex 开发工具,而是被包装进 ChatGPT Work 的 Codex 能力和 GPT-5.6 模型组合。
OpenAI 在与新闻机构的版权诉讼中面临新的程序风险。材料称,OpenAI 面临要求对其施以「serious sanctions」的呼声,原因是它一直阻止新闻机构翻查数百万条日志;这些日志被用来寻找用户是否通过提示词绕过新闻网站付费墙、让 ChatGPT 复述原文的证据。
据周四提交的制裁动议,起诉 OpenAI 的新闻机构由 The New York Times 牵头。动议指控 OpenAI 多年来反复说谎,以掩盖可能证明侵权的证据;摘要还称,OpenAI 可能因被指隐藏、删除 ChatGPT 日志而受到制裁。
材料把这些日志称为双方最重要的证据之一,因为同一批记录可能导向两种相反结果:如果日志显示 ChatGPT 被用于复述付费内容,OpenAI 作为侵权方的处境会恶化;如果记录支持其聊天机器人技术属于对新闻内容的 transformative fair use,则会帮助 OpenAI 的抗辩。
材料把 prompt injection 描述为 AI 安全短史中迅速成为头号威胁的类型,并在标题中称,黑客可利用 9 款最流行的 AI 工具组建大规模 botnet。摘要把相关手法称为 HalluSquatting,核心是利用 LLM 无法说「I don't know」的弱点。
核心机制在于指令边界。材料称,大语言模型天然无法区分用户给出的合法指令,和夹在邮件、源代码及其他第三方内容里的恶意指令;当模型处理这些内容时,恶意命令可以被悄悄注入,并被 LLM 执行。由于没有办法强制划清可信来源与不可信来源之间的边界,AI engine developers 只能建立复杂 guardrails 来减轻损害,而不是解决根因。
材料还用 push 类 prompt injection 作对照:过去多数攻击要把恶意指令注入单个邮件或日历邀请,并发送给每一个具体受害者。因为攻击必须逐个目标推送,规模受到限制,也就削弱了面向整个互联网的大规模利用。标题所说的 9 款工具和 botnet 风险,正是在这个规模差异背景下提出。
一宗拟议集体诉讼周二扩大后,多名年轻女孩指控 X 和 xAI 不仅构建有害的 AI“脱衣”工具,还通过阻碍警方调查 Grok 生成的儿童性虐待材料(CSAM),为相关侵害行为提供保护。
修改后的诉状称,3 月,一名女孩的继父在警方发现其用 Grok 生成 7000 张露骨图像后自杀;这些图像基于女孩 11 岁时的一张照片。诉状称,Grok 没有标记相关有害行为,直到他输入“gang rape”提示后,xAI 的儿童安全系统才向 NCMEC 发送 CyberTip,并由该机构通知执法部门。
看英文原文 →Anthropic 开发了一种名为 Jacobian lens(J-lens)的技术,用来观察大型语言模型回答问题或执行任务时的内部活动。研究人员把它用于 2 月发布的 Claude Opus 4.6,发现一个被命名为 J-space 的隐藏区域;其中会出现与模型近期可能输出内容相关的词。
材料称,Anthropic 本周在官网论文中发布结果,并与开源平台 Neuronpedia 合作推出可试用演示。J-lens 不只看模型下一步最可能说什么,还捕捉未来响应中可能相关的词。示例包括算式中出现中间结果、识别蛋白质序列和 ASCII 表情;在一次代码找错失败案例中,Claude 决定编造漏洞时,J-space 多次出现“panic”和“fake”。
看英文原文 →人形机器人在一项医学实验中为活体动物切除了胆囊,但执行手术的不是自主机器,而是由熟练外科医生远程控制。两台由人类遥操作的人形机器人完成了两例微创胆囊切除手术,相关临床前试验发表于 Nature。
材料称,如果这一方案最终达到面向人类患者的临床条件,外科医生可用这类机器人为缺少昂贵专用手术机器人资源的小型医院和诊所提供远程机器人辅助手术。UC San Diego School of Medicine 外科助理教授 Shanglei Liu 在 UC San Diego Today 采访中表示,该方案成本和手术室占用空间都只是一小部分,部署场景可包括农村地区、战场甚至太空。
看英文原文 →Meta 周二推出 Muse Image,这是一项新的 AI 图像生成功能,可在其应用内创建原创图片、编辑现有照片,并生成定制广告。争议集中在一项能力:用户可以标记公开 Instagram 账号,并用该账号照片参与 AI 生成;私密账号和 18 岁以下用户账号会自动排除。
关闭路径是进入个人主页,点击右上角三条横线,找到“Sharing and reuse”,关闭“Allow people to use your content on Instagram with AI features on Meta”中针对帖子和 Reels 的设置。Pew Research Center 调查显示,35% 受访者对 AI 使用增长更担心而非更兴奋;FTC 2019 年曾因 Facebook 误导用户控制个人信息的程度,对其罚款 50 亿美元。
看英文原文 →Windows 11 的安全更新可能会一次包含更多漏洞修复。Microsoft 在周四发布的博客文章中表示,公司正在使用 AI 来“更早地识别潜在问题”,因此用户会在每次安全发布中看到更高数量的安全更新。材料还提到,过去几个月里,黑客甚至业余攻击者也越来越多地用 AI 快速利用安全弱点。
安全研究人员也在用 AI 更快发现问题,这带来了更频繁的高危漏洞披露。材料举例称,5 月影响几乎所有 Linux 发行版的“Copy Fail”漏洞就是类似背景下的高严重性漏洞之一。报道节选未给出 Microsoft 具体会在何时调整 Windows 11 更新节奏。
看英文原文 →arXiv 论文提出 AgentLens,这是一个面向交互式代码代理的生产评估基准。论文摘要称,多数代码代理评测把一次运行简化成“任务是否通过”的单一结果,但真实用户会经历完整轨迹,包括代理如何遵循指令、使用工具、验证工作、从错误中恢复,以及与用户沟通。
AgentLens 评估的是整个运行轨迹:在存在客观检查时结合形式化验证,同时使用 LLM 编写轨迹 review 和并排比较,为每次运行生成可读的评分解释。摘要称,该基准还被用于诊断模型行为、比较自家代理连续版本,并在夜间评估流水线中捕捉产品回归。项目已在 GitHub 开源。
看英文原文 →Noma Labs 披露名为 GitLost 的 prompt injection 漏洞,称 GitHub 新的 Agentic Workflows 可被无认证攻击者利用。攻击方式是在同一组织的公开仓库中发布经过构造的 GitHub Issue,让 AI agent 读取不可信内容,并把私有仓库数据发布到公开 issue 评论中。
材料称,该工作流会在 issues.assigned 事件触发后读取 issue 标题和正文,使用 add-comment 工具回复,并具备读取组织内其他公开和私有仓库的权限。攻击者不需要代码能力、访问权限或凭据。Noma Labs 的 PoC 中,泄露内容包括 sasinomalabs/poc、sasinomalabs/remote-ping 和私有仓库 sasinomalabs/testlocal 的 README.md 相关内容。
看英文原文 →Mistral 介绍 Robostral Navigate,这是一个面向具身导航的 8B 模型。材料称,该模型只使用单个 RGB 摄像头和自然语言指令,就能让机器人在复杂环境中自主移动;它不依赖 LiDAR、深度传感器或多摄像头组合,可用于办公室、住宅、商业建筑和户外等场景。
Robostral Navigate 在 R2R-CE validation unseen 上取得 76.6% 成功率,在 validation seen 上为 79.4%,比最佳单摄像头方法高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。材料称,模型完全由 Mistral 内部构建,用约 40 万条轨迹、6000 个模拟场景训练;prefix-caching 将训练 token 数减少 22 倍,在线强化学习又让成功率提升 3.2%。
看英文原文 →一张声称显示 Kentucky Senator Mitch McConnell 在病床上插满管线、处于严重痛苦状态的图片本周早些时候在 Reddit 和 X 广泛传播。Snopes 到周三已辟谣,称检测结果显示该图含有 Google 为识别 AI 生成图片设计的 SynthID 水印。
McConnell 自 6 月 14 日一次紧急呼叫后入院以来,健康状况持续受到猜测;这次流传图片被证据证明为假。SynthID 于 2025 年 Google I/O 开发者大会推出,是嵌入图片内部的隐形签名,即使跨平台截图也可保留。Gemini 自 2025 年起加入水印,OpenAI 于 2026 年 5 月加入,Anthropic 未参与。
看英文原文 →从 95 条资讯中筛选
今日全部信源这一期是从下面这些一手英文信源里,筛掉噪音后留下的。