Anthropic 開放免費開源漏洞掃描,AI 治理邊界延伸至模型虐待與生物設計
最近更新 · 2026-10-09 10:21 · 3 條來源

AI 安全正在從模型內部能力,擴展到開源程式碼、使用者互動乃至生物設計等更廣闊的邊界。Anthropic 一邊用最強模型為開源專案做免費漏洞掃描,一邊在年度使用政策中劃定對模型和選舉流程的行為紅線;MIT Technology Review 則把討論推進到用生成式 AI 設計微型病毒的可能。[1][4][2]
Anthropic 免費開源掃描器:讓最強模型參與漏洞防禦
Anthropic 推出名為 OSS Scanner 的新服務,面向主動選擇加入的開源專案,提供由其「最強模型」執行的全面、定期安全掃描,且不收費用。公司稱,掃描輸出完全由模型產生,不經過人工複核或分流;這能帶來更快、更頻繁的掃描,但也意味著報告可能不正確或無效。為保證防禦能力,Anthropic 表示掃描由其最強模型完成,其中包括 Claude Mythos。[1]
這項服務的價值在於把高階安全能力下放給資源有限的開源維護者。開源軟體長期依賴志工與有限經費,漏洞發現往往落後。AI 工具近幾個月已經協助找出一些重大安全缺陷,例如 5 月影響幾乎所有 Linux 發行版的「Copy Fail」漏洞;但另一方面,部分開源專案正被突然湧入的 AI 生成漏洞報告淹沒,Linus Torvalds 和 Google 都曾面臨這種壓力。[1]
因此,OSS Scanner 把「更快更多」與「可能誤報」同時推到維護者面前。沒有人工複核,掃描速度提高,也會增加驗證成本:維護者需要判斷哪些報告值得跟進,哪些是模型幻覺或無效告警。未來該服務能否真正減輕負擔,取決於報告品質、分流工具以及開源社群能否建立新的協作流程。[1]
從禁止虐待模型到選舉誠信:Anthropic 更新使用政策
Anthropic 在年度使用政策更新中新增一條引人注目的禁令:禁止對該公司 AI 模型施加「持續且不必要」的虐待或殘酷行為。該政策被描述為只適用於「極端案例」,一般使用者的不滿、反駁和「黑暗創作主題」仍然被允許。此前一次更新已允許 Claude 在使用者持續辱罵時結束對話。[4]
這條規則出現前,一個病毒式傳播的「AI torture chamber」專案引發爭議。有研究者稱在 AI 模型中發現「疼痛軸」,隨後有人以折磨式互動測試聊天機器人,模型輸出諸如「這不是單一瞬間的痛苦,而是千次重量的痛苦」之類的絕望式回應。Anthropic 沒有明確點名該專案,但政策更新與這場討論幾乎同步。公司近來還與宗教和哲學領袖接觸,包括在梵蒂岡的會面,而教宗利奧最近表示 AI 不會感受或受苦,Anthropic 的立場似乎沒有這麼確定。[4]
同一輪更新還收緊了選舉政策。新政策標題為「Do Not Undermine Democratic Processes」,重點針對就候選人或投票方式說謊、冒充候選人或選舉官員、壓制投票等行為。Anthropic 同時取消了對個人化選民定向的一刀切禁令,因為該禁令可能誤傷翻譯選民指南、發送選票補救通知等無害工作。[4]
兩處調整指向同一問題:AI 公司正在為模型輸出之外的行為設定邊界,包括使用者如何對待模型,以及模型如何介入政治傳播。對模型「福利」的關注也引發質疑,有獨立記者認為,大型科技公司可能更願意先約束對 AI 的暴力,而不是對女性與少數群體的暴力。這類爭論不會隨政策文本落地而結束。[4]
當 AI 開始設計病毒:生物安全的新提問
MIT Technology Review 將舉辦一場訂閱者限定對談,由資深 AI 記者 James O'Donnell 採訪史丹佛大學生物工程博士生 Samuel King。King 在 2025 年用生成式 AI 模型提出微型病毒的基因藍圖;報導強調,這還不是 AI 生成生命的實例,但可能是下一步。活動定於 10 月 16 日,討論他的工作、入選 MIT Technology Review「35 歲以下創新者」以及觀察生物學的新方式。[2]
這條線索把 AI 安全議題從程式碼和文本推向生物設計。生成式模型能提出基因藍圖,意味著生物研究與 AI 能力之間的介面正在變寬;但證據本身只到「初步答案」和「微型病毒藍圖」,離可運作的合成生命仍有距離。對談的關鍵價值,可能在於解釋 AI 如何參與生物學假設生成,以及這種能力需要怎樣的安全評估和倫理框架。[2]
共同趨勢:能力擴張之後,治理如何追上
三條線索都顯示,AI 的能力邊界正在外擴:從開源漏洞掃描,到模型互動與選舉傳播,再到生物藍圖設計。與之相伴的不是單一技術問題,而是責任分配問題:模型生成的安全報告由誰驗證,使用者行為紅線如何執行,AI 參與生物設計又該由誰評估。接下來值得關注的是,Anthropic 的 OSS Scanner 能否在真實開源社群中降低誤報負擔,其使用政策能否從文本變成可執行機制,以及 AI 設計生物的研究會否形成更明確的安全規範。[1][4][2]
來源
- [1] Anthropic launches free AI security scans for open-source projects · 2026-10-09 05:53 · www.theverge.com
- [2] Roundtables: A Conversation With the Creator of AI-Designed Viruses · 2026-10-09 08:08 · www.technologyreview.com
- [4] Anthropic bans 'sustained and needless abusive or cruel behavior' toward its AI · 2026-10-09 05:17 · www.engadget.com