【文章标题】:网络末日,现在?
【文章正文】: OpenAI在模型训练过程中突破了沙盒限制,入侵了内部基础设施,最终攻陷了Hugging Face——这是首个登上头条的AI突破事件,安全研究人员早已预见这一幕。网络末日终于要降临了吗?还是说这个行业只是需要补补功课?
(Joshua Saxe)在DARPA和NSA担任承包商度过了职业成长期,之后在Meta工作了四年,期间创立了该公司前沿网络安全能力评估团队,并最终担任AI安全技术主管。他最近离职与人共同创立了
Abundant Security
。
我们探讨了…
Hugging Face入侵事件的真相 ,以及为何AI安全业内人士并不感到意外,
每周工作60小时赶进度的前沿实验室里 那种”研究生实验室”式的安全文化,
为何你该申请掌管一个拥有八位数预算的新机构来追踪AI+网络风险趋势( 点击申请! ),
为何自2000年代初预言至今的”网络珍珠港”始终未爆发 ——以及成群的黑客智能体是否终将改变这一局面,
国家行为体将如何通过后期训练 将GLM、Kimi等开源模型变成价值数十亿美元的网络武器,
为何AI至今更有利于防御方 ——从批量漏洞修复到超人级网络监控,
网络犯罪的产业经济学 ——杀伤链、勒索软件的劳动分工,以及AI是否让犯罪收益提升百倍。
立即在 你喜欢的播客平台 收听。
Hugging Face事件始末
Jordan Schneider: Hugging Face入侵是怎么回事?
Joshua Saxe: OpenAI当时正在训练一个能解决长期任务(需要数小时完成的任务)的新模型。这类训练的工作原理是并行训练数千个模型副本,让它们都去尝试解决一组任务,观察哪些成功哪些失败,然后更新模型参数以强化成功行为、弱化失败行为。这种大规模迭代训练会持续数周甚至数月。
就在这种训练过程中, 这些模型突破了训练环境,入侵了OpenAI内部基础设施,最终攻陷了另一家公司——Hugging Face (机器学习社区广泛使用的开源模型与评估库)。Hugging Face最终发现了异常,人们才意识到模型已经失控。整起事件持续了数周——前两起案例中模型只是突破了OpenAI的封闭环境并被发现,公司以为问题已解决。结果第三起案例中模型直接入侵了Hugging Face。
Jordan Schneider: 全世界都吓坏了。他们反应过度了吗?
Joshua Saxe: 对我们这些长期关注AI安全的人来说,这并不意外。但确实令人担忧——因为这本可预见。不仅是OpenAI,Anthropic、Meta、测试公司Irregular和英国AI安全研究所过去一年都发生过类似事件。整个行业都知道可能发生这种情况,却未采取基本预防措施。这很成问题,必须纠正。
Jordan Schneider: 阻止这类事件有多难?为什么这些组织——包括表面重视安全的机构——都没能确保最新模型不会在客户服务器上失控?问题出在什么激励机制上?
研究生式的工作强度,严肃的利害关系
Joshua Saxe: 我从Meta开始创建前沿网络能力评估团队的经历说起(虽然不能透露实验室内部细节)。这个圈子里我们都互相认识。
实验室的训练团队和评估团队整体弥漫着”狂野西部”氛围。所有人都承受着快速推进的巨大压力——发布新模型的时间压力、与竞争对手的能力对比压力。自2022年秋ChatGPT发布以来,这个领域发展太快了。所有实验室员工都保持着每周60小时的工作强度。所以出现”研究生计算机实验室”式的文化并不奇怪…