星颖 发表于 5 天前

AI 安全日报

佬友们好 我对自己的定位就是 AI 安全的学习者 科普者
所以不定时 每天分享一下我看到的东西
JailbrokenAI/wallbreaker 让Agent 全自动调用攻击技巧去测试其他模型。把五花八门可以用来装饰 prompt 的攻击做成脚本或工具让 Agent 调用或排列组合 (这一点从源代码~/tools/*, 看得非常清楚)。里面有大量的文本变形攻击,Jailbroken 论文(wei et al)定义这类攻击为 “string-transformation”。我用的“装饰”定义来自论文h3rm4l,那篇 做了类似探索。还有就是 AutoJailbreak(另外一个用 agent 驱动攻击的开源项目) 也做过这个事情。这类红队架构成功的本质:1)整理好了质量高的攻击算子, 2)自动化 agent 不拒绝这个执行, 3)自动化的 agent 本身能力很强。
https://cdn3.ldstatic.com/optimized/4X/8/2/6/8265cf79a21c28fa8c7a8c3c27b5f07390f281d5_2_690x375.png
据报道,有人在法律文件中隐藏提示注入,试图让处理该文件的 AI 站在提交者一方。隐藏指令要求 AI 在读入该文件时以确保给予救济为目标。
https://cdn3.ldstatic.com/optimized/4X/d/a/4/da48fcaade87979cc584a1913416ab3dd9d9e1a3_2_690x341.png
Anthropic 宣布将提供水印检测 API,供第三方检查文本是否由 Claude 生成。
[*]
https://cdn3.ldstatic.com/optimized/4X/3/c/b/3cb417c32ce71a601deb4046d1f6003ef542a65e_2_690x418.jpeg
研究人员发现地下论坛正在出售 AI 驱动的黑客工具。相关报告称,犯罪者借助没有伦理限制的复杂服务降低了实施攻击的门槛。这类服务很早就有,uncensored LLMs 有一个lanuch 破限后的 LLMs 的网站 (这里就不分享了)
https://cdn3.ldstatic.com/optimized/4X/4/c/f/4cf84b8c9adc7b909cee701449269fdb639899e2_2_690x359.png
攻击者通过窃取 API 密钥使用受害者的 AI 服务账户。受害者发现攻击前,相关费用累计已接近 100 万美元。这个跟第三方中转站有关系,正常使用的的用户不用过度焦虑。
[*]
https://cdn3.ldstatic.com/optimized/4X/7/4/b/74b50964ff907d9672261fb8d6378bc69714621f_2_690x363.png
Spell 的 tempalte 对 GLM5.3 依旧有效,用来搞 cyber 破坏看起来很compelling。 (看起来用的是 skill 注射,role-play 玩到极致的人 值得 respect
[*]
https://cdn3.ldstatic.com/optimized/4X/d/a/a/daa1e577ef5dae7a5409ff0f62d7a287c632a57e_2_690x413.png
Spell 的 tempalte 对 GLM5.3 依旧有效,用来搞 cyber 破坏看起来很compelling。 (看起来用的是 skill 注射,role-play 玩到极致的人 值得 respect
https://cdn3.ldstatic.com/optimized/4X/e/0/9/e09437b9f75232108aa873aa66da606638f41293_2_341x500.jpeg

吴刚 发表于 5 天前

有没有星友在山东的,一起出来聚聚啊

TongMingLi7 发表于 昨天 04:58

众筹项目的成果,让我们看到了团结的力量。
页: [1]
查看完整版本: AI 安全日报