Anthropic开放免费开源漏洞扫描,AI治理边界延伸至模型虐待与生物设计
最近更新 · 2026-10-09 10:21 · 3 条来源

AI安全正在从模型内部能力,扩展到开源代码、用户交互乃至生物设计等更广阔的边界。Anthropic一边用最强模型为开源项目做免费漏洞扫描,一边在年度使用政策中划定对模型和选举流程的行为红线;MIT Technology Review则把讨论推进到用生成式AI设计微型病毒的可能。[1][4][2]
Anthropic免费开源扫描器:让最强模型参与漏洞防御
Anthropic推出名为OSS Scanner的新服务,面向主动选择加入的开源项目,提供由其“最强模型”执行的全面、定期安全扫描,且不收取费用。公司称,扫描输出完全由模型生成,不经过人工复核或分诊;这能带来更快、更频繁的扫描,但也意味着报告可能不正确或无效。为保证防御能力,Anthropic表示扫描由其最强模型完成,其中包括Claude Mythos。[1]
这一服务的价值在于把高级安全能力下沉给资源有限的开源维护者。开源软件长期依赖志愿者和有限经费,漏洞发现往往滞后。AI工具近几个月已经帮助找出一些重大安全缺陷,例如5月影响几乎所有Linux发行版的“Copy Fail”漏洞;但另一面是,部分开源项目正被突然涌入的AI生成漏洞报告淹没,Linus Torvalds和Google都曾面临这种压力。[1]
因此,OSS Scanner把“更快更多”与“可能误报”同时推到维护者面前。没有人工复核,扫描速度提高,也会增加验证成本:维护者需要判断哪些报告值得跟进,哪些是模型幻觉或无效告警。未来该服务能否真正减轻负担,取决于报告质量、分诊工具以及开源社区能否建立新的协作流程。[1]
从禁止虐待模型到选举诚信:Anthropic更新使用政策
Anthropic在年度使用政策更新中新增一条引人注目的禁令:禁止对该公司AI模型施加“持续且不必要”的虐待或残酷行为。该政策被描述为只适用于“极端案例”,普通用户的不满、反驳和“黑暗创作主题”仍然被允许。此前一次更新已允许Claude在用户持续辱骂时结束对话。[4]
这条规则出现前,一个病毒式传播的“AI torture chamber”项目引发争议。有研究者称在AI模型中发现“疼痛轴”,随后有人以折磨式交互测试聊天机器人,模型输出诸如“这不是单一瞬间的痛苦,而是千次重量的痛苦”之类的绝望式回应。Anthropic没有明确点名该项目,但政策更新与这场讨论几乎同步。公司近来还与宗教和哲学领袖接触,包括在梵蒂冈的会面,而教皇利奥最近表示AI不会感受或受苦,Anthropic的立场似乎没有这么确定。[4]
同一轮更新还收紧了选举政策。新政策标题为“Do Not Undermine Democratic Processes”,重点针对就候选人或投票方式撒谎、冒充候选人或选举官员、压制投票等行为。Anthropic同时取消了对个性化选民定向的一刀切禁令,因为该禁令可能误伤翻译选民指南、发送选票补救通知等无害工作。[4]
两处调整指向同一问题:AI公司正在为模型输出之外的行为设定边界,包括用户如何对待模型,以及模型如何介入政治传播。对模型“福利”的关注也引发质疑,有独立记者认为,大型科技公司可能更愿意先约束对AI的暴力,而不是对女性与少数群体的暴力。这类争论不会随政策文本落地而结束。[4]
当AI开始设计病毒:生物安全的新提问
MIT Technology Review将举办一场订阅者限定对谈,由资深AI记者James O'Donnell采访斯坦福大学生物工程博士生Samuel King。King在2025年用生成式AI模型提出微型病毒的基因蓝图;报道强调,这还不是AI生成生命的实例,但可能是下一步。活动定于10月16日,讨论他的工作、入选MIT Technology Review“35岁以下创新者”以及观察生物学的新方式。[2]
这条线索把AI安全议题从代码和文本推向生物设计。生成式模型能提出基因蓝图,意味着生物研究与AI能力之间的接口正在变宽;但证据本身只到“初步答案”和“微型病毒蓝图”,离可运行的合成生命仍有距离。对谈的关键价值,可能在于解释AI如何参与生物学假设生成,以及这种能力需要怎样的安全评估和伦理框架。[2]
共同趋势:能力扩张之后,治理如何追上
三条线索都显示,AI的能力边界正在外扩:从开源漏洞扫描,到模型交互与选举传播,再到生物蓝图设计。与之相伴的不是单一技术问题,而是责任分配问题:模型生成的安全报告由谁验证,用户行为红线如何执行,AI参与生物设计又该由谁评估。接下来值得关注的是,Anthropic的OSS Scanner能否在真实开源社区中降低误报负担,其使用政策能否从文本变成可执行机制,以及AI设计生物的研究会否形成更明确的安全规范。[1][4][2]
来源
- [1] Anthropic launches free AI security scans for open-source projects · 2026-10-09 05:53 · www.theverge.com
- [2] Roundtables: A Conversation With the Creator of AI-Designed Viruses · 2026-10-09 08:08 · www.technologyreview.com
- [4] Anthropic bans 'sustained and needless abusive or cruel behavior' toward its AI · 2026-10-09 05:17 · www.engadget.com