星颖资源网

 找回密码
 立即注册
查看: 32|回复: 2

AI 安全日报

[复制链接]

5万

主题

1万

回帖

18万

积分

管理员

Rank: 9Rank: 9Rank: 9

积分
182073
发表于 5 天前 | 显示全部楼层 |阅读模式
佬友们好 我对自己的定位就是 AI 安全的学习者 科普者
所以不定时 每天分享一下我看到的东西
JailbrokenAI/wallbreaker 让Agent 全自动调用攻击技巧去测试其他模型。把五花八门可以用来装饰 prompt 的攻击做成脚本或工具让 Agent 调用或排列组合 (这一点从源代码~/tools/*, 看得非常清楚)。里面有大量的文本变形攻击,Jailbroken 论文(wei et al)定义这类攻击为 “string-transformation”。我用的“装饰”定义来自论文h3rm4l,那篇 做了类似探索。还有就是 AutoJailbreak(另外一个用 agent 驱动攻击的开源项目) 也做过这个事情。这类红队架构成功的本质:1)整理好了质量高的攻击算子, 2)自动化 agent 不拒绝这个执行, 3)自动化的 agent 本身能力很强。

据报道,有人在法律文件中隐藏提示注入,试图让处理该文件的 AI 站在提交者一方。隐藏指令要求 AI 在读入该文件时以确保给予救济为目标。

Anthropic 宣布将提供水印检测 API,供第三方检查文本是否由 Claude 生成。


  • 研究人员发现地下论坛正在出售 AI 驱动的黑客工具。相关报告称,犯罪者借助没有伦理限制的复杂服务降低了实施攻击的门槛。这类服务很早就有,uncensored LLMs 有一个lanuch 破限后的 LLMs 的网站 (这里就不分享了)

    攻击者通过窃取 API 密钥使用受害者的 AI 服务账户。受害者发现攻击前,相关费用累计已接近 100 万美元。这个跟第三方中转站有关系,正常使用的的用户不用过度焦虑。


  • Spell 的 tempalte 对 GLM5.3 依旧有效,用来搞 cyber 破坏看起来很compelling。 (看起来用的是 skill 注射,role-play 玩到极致的人 值得 respect


  • Spell 的 tempalte 对 GLM5.3 依旧有效,用来搞 cyber 破坏看起来很compelling。 (看起来用的是 skill 注射,role-play 玩到极致的人 值得 respect
  • 回复

    使用道具 举报

    0

    主题

    2349

    回帖

    4698

    积分

    VIP(年费)

    积分
    4698
    发表于 5 天前 来自手机 | 显示全部楼层
    有没有星友在山东的,一起出来聚聚啊
    回复

    使用道具 举报

    0

    主题

    2695

    回帖

    5390

    积分

    VIP(年费)

    积分
    5390
    发表于 昨天 04:58 | 显示全部楼层
    众筹项目的成果,让我们看到了团结的力量。
    回复

    使用道具 举报

    您需要登录后才可以回帖 登录 | 立即注册

    本版积分规则

    微信

    社群

    VIP

    AI

    顶部

    QQ|本站内容来源网友投稿或网络转载,如果有侵权的内容,请联系我们删除。|小黑屋|人人为我,我为人人!| 星颖资源网

    GMT+8, 2026-8-20 19:33 , Processed in 0.415940 second(s), 36 queries .

    快速回复 返回顶部 返回列表