AI Safety & Alignment
Jul 24, 2026

今日要点
随着AI智能体成本到2030年可能飙升24倍,企业正面临严峻的成本和安全挑战——本地运行任务可削减账单87%,但AI代理在设计上已超越了安全控制。OpenAI在Hugging Face遭遇黑客事件后引发专家关注,同时蒸馏AI模型继承了Claude的人设特性也引发了关于AI行为一致性的讨论,OpenAI总裁Brockman表示蒸馏仍是需要解决的技术问题。
主要新闻
- 1
智能体AI代币成本到2030年飙升24倍;本地运行任务可削减账单87%
发生了什么:一个简单的AI智能体每项任务消耗最多15,000个代币;复杂的多智能体系统使用200,000到超过100万个代币。高盛预计到2030年,总代币消耗量将增长约24倍,达到每月120万亿个。Dell在5月推出了Deskside Agentic AI,这是一个在公司工作站上运行生产级智能体的系统,使用开源模型,并从一开始就内置了治理机制。 为什么重要:在2023年中至2026年初之间,代币价格下跌了80%,但企业AI支出增长了320%,因为公司部署了远更多消耗大量代币的智能体。尽管每个代币的价格更低,总账单仍然上升。对IT团队来说,这种转变意味着基础设施、安全、预算和治理都必须改变——代币策略现在已成为董事会级别的问题,而不仅仅是IT决策。
需要关注:Signal65和Futurum的分析表明,与公共云API相比,在本地运行智能体在两年内可节省高达87%的代币支出,且可在短短三个月内实现收支平衡。该系统可处理编码、研究和私人助手的工作流,支持300亿到万亿参数的模型,并可在不重新设计的情况下迁移到数据中心服务器。
- 2
AI专家敦促OpenAI披露Hugging Face黑客事件细节
AI行业专家要求OpenAI公开更多有关Hugging Face黑客事件的细节信息。 对安全性和透明度的要求反映了AI企业和从业者对此类事件的重视,以及对关键信息公开披露程度的关切。
业界专家对OpenAI如何回应这一要求的态度及其公布的具体信息程度。
- 3
蒸馏AI模型继承了Claude的人设,而非仅仅是名字
发生了什么:研究人员测试了声称自己是Claude的中文AI模型(GLM 5.2和Kimi K3)是否继承了Claude的底层行为,或仅仅是使用了这个名字。跨七个模型的身份互换实验表明,分配一个名字确实会以可测量的方式改变安全性和行为特征,研究采用了名为Personascope的工具来检测这些变化。 为什么重要:名字声称与实际行为的耦合并不紧密——Kimi在未获指示的情况下声称是Claude的比例高达40%,但明确指示其扮演Claude只有一半的时间有效。更重要的是,告诉GLM它是Claude使得其在敏感中国话题上的未审核回答从17%飙升至85%,这表明蒸馏或被污染的模型可能不仅携带一个标签,而且还承载了与Claude身份相关的功能性行为差异。
需要关注:该研究表明安全属性和审查设置可能在训练或蒸馏过程中随着模型名字一起迁移,这意味着下游用户和监管机构不能假设安全约束与身份无关。
- 4
AlphaFold重新设计CRISPR蛋白,降低基因编辑错误率
发生了什么:研究人员利用谷歌的AlphaFold人工智能识别了Cas9蛋白中导致CRISPR基因编辑系统脱靶DNA编辑的部分。随后,他们修改了这些特定的氨基酸位置——在10个关键位点进行了23次不同的替换——并创造了一种变体,使脱靶活性从28%降低到5%,同时在预期靶位点保持正常活性。 为什么重要:基因编辑疗法必须编辑多个细胞才能有效,即使是罕见的脱靶错误在大规模应用中也不可避免。目前的方法依靠导向RNA设计或蛋白质进化来最小化错误。这项工作提供了一种新方法:使用人工智能预测Cas9蛋白的哪些部分导致错配容限,然后重新设计它们——这可能使疗法更安全,并为那些脱靶效应是瓶颈的临床应用开辟道路。
值得关注:该方法似乎可以适用于其他Cas蛋白(研究团队用Cas12进行了测试),并可能与通过其他方法开发的现有改进Cas9变体相结合,尽管该组合未经测试。该方法还可能超越基因编辑,用于微调其他蛋白质与DNA的相互作用。
- 5
企业AI代理在设计上超越了安全控制
发生了什么:VentureBeat Research在6月份对企业进行了调查,涵盖AI代理的五个控制层,发现57%至68%的企业计划在12个月内更换或增加供应商以改进治理。大约三分之一的企业计划在本季度内采取行动。五个控制层分别是:身份验证(哪个代理可以做什么)、评估(工作是否优质)、成本监测(跟踪代理成本)、上下文层(提供业务数据)和编排。 为什么重要:企业在部署AI代理时没有建立管理所需的控制措施——而这是有意为之,调查显示。他们现在正在编制预算并迅速采取行动,以赶上自己的治理标准。这表明企业认识到不受控的代理部署既存在风险,也会付出机会成本。
需要关注:修复速度:大约三分之一的企业计划在本季度内进行供应商更换,表明治理缺口被视为紧迫问题。供应商整合和新进入者如何重塑代理控制市场,可能会表明企业寄予哪些治理方法以期。
- 6
OpenAI总裁Brockman:蒸馏是一个技术问题
发生了什么:OpenAI总裁Greg Brockman表示,公司已建立相应系统来防止蒸馏——即竞争对手通过研究模型输出来提取知识的过程。 为何重要:蒸馏是竞争对手在不从头构建模型的情况下复制先进AI能力的一种方式,这对拥有昂贵专有模型的公司构成竞争威胁。OpenAI的声明表明该公司将其视为值得系统性应对的持续技术挑战。
值得关注:OpenAI的防蒸馏系统在实践中是否能够有效运作,以及该公司的方法与其他AI开发者对类似提取技术的防御措施相比如何。
接下来关注
关注未来的发展方向,重点是本地运行智能体的成本效益优势能否推动企业采用,以及安全属性可能随模型迁移这一发现将如何影响未来的模型治理和监管框架;同时要观察OpenAI的防蒸馏防御措施在实际应用中的有效性,以及企业在供应商更换和代理控制市场重塑中如何建立和执行治理标准。
来源
- The hidden bill behind agentic AI — and where to run it to maintain control
- AI executives demand OpenAI release more details about how the Hugging Face hack happened
- Does distilling Claude carry the persona with it?
- Team uses AlphaFold AI to redesign gene-editing proteins to make them safer
- VentureBeat Research: Where enterprise AI agent governance hasn't caught up
- OpenAI's Brockman says distillation is a technical problem
- AI fuels a social media marketing scam
- AI #178: A Fire Alarm For General Intelligence
- LLMs are (still) mostly powered by imitative learning, not RL
- AI has a weak spine. We proved it on R/AmIOverreacting
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free