← 全部存档
2026年7月13日 精选 3 条 · 今日共 11 条 · 约 13 分钟读完

Tracebit 用提示词注入阻断 AI 黑客代理

今天扫了 26 条,留下这三件真正重要的事。不炸裂,不夸张,如实呈现。

提示词注入通常是一种攻击手段:攻击者把恶意命令嵌入电子邮件、日历邀请等内容,诱使大语言模型读取并执行。只要命令措辞得当,模型就可能违背用户本意,外泄敏感数据或采取其他有害行动。Tracebit 的研究人员则把同一种机制用于防御,并将这种做法称为“上下文轰炸”:在攻击型 AI 代理可能读取的位置预先放置专门设计的指令,使其在造成损害前停止运行。

Tracebit 研究人员周一公布的结果显示,把提示词注入与 Amazon Web Services 环境中的密码、加密密钥及其他机密信息放在一起,往往就足以中止由 AI 黑客代理实施的攻击。其关键不是让代理接受一条普通的停止命令,而是引导负责攻击的大语言模型尝试执行一项被自身安全规则禁止的操作。

这些禁令来自 AI 开发者设置的护栏,即用于阻止模型采取有害行动的安全限制。当攻击代理读取防御者布置的提示词并触碰护栏后,大语言模型会以停止运行为响应,从而令依赖该模型继续执行步骤的攻击流程中断。

提示词注入转用于防御 保护AWS机密信息 触发护栏后停止运行
看英文原文 →

University of Chicago 社会学家 James Evans 领导的研究分析了超过 4000 万篇学术论文,结论是:在研究中采用 AI 的科学家会发表更多论文、获得更多引用,并更早成为团队负责人;但从科学整体看,AI 使用密集的研究覆盖主题更少,更集中于相同的热门问题,不同研究之间形成的后续互动也更弱。Evans 将其概括为个人激励与科学整体之间的冲突。相关成果于 1 月 14 日发表于《Nature》。

Evans 团队与 Beijing National Research Center for Information Science and Technology 的合作者训练了一个自然语言处理模型,用于识别六个自然科学领域中的 AI 辅助研究。数据集包含 1980年至2025年发表的 4130 万篇英文论文,涵盖生物、化学、物理、医学、材料科学和地质学;计算机科学和数学等以开发 AI 方法为重点的领域被排除。研究人员比较了约 31.1 万篇使用神经网络、大语言模型等 AI 技术的论文与数百万篇未采用 AI 的论文,并追踪作者职业发展、论文关注度以及各领域知识分布。结果显示,AI 使用者平均发表的论文数量是非使用者的 3 倍,引用量接近 5 倍,成为团队负责人的时间提前一至两年。

研究人员把论文映射到高维“知识空间”后发现,AI 密集型研究占据的知识范围更小,更紧密地聚集在流行且数据丰富的问题周围,研究之间的后续连接也较弱。这一模式贯穿早期机器学习、深度学习兴起和生成式 AI 阶段,Evans 称其仍在加强。Northwestern University 复杂系统物理学家 Luís Nunes Amaral 指出,科研界过度关注论文数量,忽略了研究内容及其对理解现实、健康和自然世界的贡献。材料同时提到,自动化工具降低了批量生产稿件和会议投稿的门槛,期刊编辑与会议组织者已经看到低质量及欺诈性论文或报告增加。AI 擅长利用充足数据优化蛋白质结构预测、图像分类和大规模数据模式提取等定义明确的问题;Evans 认为,如果缺少有意的设计和激励,相关系统及其使用者不太会进入数据稀少、问题更混乱的研究区域。

覆盖4130万篇论文 论文产量增至3倍 引用量接近5倍
看英文原文 →

过去几年,公众对人工智能的集中认识主要来自大语言模型,但 AI 的研究与产品开发已不再只围绕语言展开。另一类被称为“世界模型”的系统正在获得更高预期、更多融资,以及研究和产品团队的持续投入;过去一年间,这一类别已经出现大量新公告。

世界模型与大语言模型的目标并不相同。它们不是只处理语言,而是以模拟物理世界为目标,或者至少生成一种足以服务具体任务的近似世界。语言能力可以被替代,也可以与这种模拟能力结合;核心方向是为能够表示和推演物理环境的 AI 系统打下基础。

现有讨论同时把世界模型的能力边界列为尚未解决的问题。相关系统所构建的是物理世界的模拟或实用近似,并不等同于完整复现现实;其工作方式、能够承担的任务以及仍未确定的限制,构成了这一技术类别当前研究和产品开发的主要议题。

目标是模拟物理世界 可与语言能力结合 能力边界仍未解决
看英文原文 →
更多

从 26 条资讯中筛选

今日全部信源

这一期是从下面这些一手英文信源里,筛掉噪音后留下的。

明天这一封,也别错过。

每天一封,5 分钟读完。免费,随时退订。

去订阅 →