导读部分 返回列表
Anthropic发布最新威胁情报报告,披露近八个月七类AI滥用行为及防护加固思路。
正文内容
昨天翻Anthropic的安全博客,看到他们甩出了一份威胁情报报告。八个月,七类恶意用法,一条一条列清楚。我自己做逆向这么多年,看这类报告的标准只有一个:有没有细节,有没有可复现的东西。这份有。
报告覆盖的时间窗口是2025年12月到2026年8月。Anthropic的Threat Intelligence团队在这段时间里识别并中断了一批针对Claude的滥用行为。涉及模型包括Haiku、Sonnet、Opus。他们明确说,这些不是普通误用,是最值得披露的那一类。

七类领域列一下:网络攻击、影响力行动、监控、诈骗与欺诈、生物滥用、常规武器开发、以及模型蒸馏。第三条和第七类,是我最关心的。监控系统这个东西,思路和传统APT没什么区别,只是把执行层换成了语言模型。蒸馏则是另一种玩法,拿输出的数据去反向喂养一个小模型,绕过。报告里专门提到一个蒸馏案例动用了更强的模型类别,其余案例都没有。
威胁行为体画像也给了。疑似国家背景的组织、逐利的犯罪团伙、商业间谍软件供应商、国家宣传机构、政治动机的个人。从伪装成约会App的诈骗网络,到专门识别和监控异见者的监控系统。把一份威胁报告写成这样,是不打算给同行留面子。
关键句在这:攻击者会持续测试防护措施,试图绕过检测和拦截的技术手段。这句话翻译成工程语言就是,规则是消耗品,防守方必须不断重写。我看了下他们的处置流程,发现、中断、加固防护、和当局及行业伙伴共享情报,四步闭环。这个流程不新鲜,难的是每一轮都执行到位。
国内做AI产品的团队,可以对照自己的日志体系想一想。你们有没有在输出层做异常聚类?有没有把违规prompt的特征沉淀下来?如果没有,那这份报告值得认真读一遍。OWASP新风险榜那份可以把攻击面拆得更细,两篇一起看会有收获。
报告里还有一个点值得说:模型能力越强,风险越高,除非开发者和社会防线同步升级。这不是危言耸听,是已经被数据验证过的规律。我之前复盘过Anthropic模型越狱事件,两层防御的思路是一致的:一层管输入,一层管输出,中间留审计。
给三条可操作的建议。第一,把prompt注入、越狱、数据外泄三类特征单独建索引,别混在通用日志里。第二,模型路由做分级,高风险请求走更强护栏的模型,别为了省钱全走小模型。第三,定期做红队演练,自己先打自己。防守这件事,没有一劳永逸。
报告全文在Anthropic官网。想看原味的可以直接去翻,我上面引的是核心。就这样。
本文出自 AI一族,原文链接:https://www.aiyizu.cn/?p=5290
转发请注明出处,禁止未经允许用于任何商业用途。