当前标签:AI安全

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

花1500美元发起一场“AI黑客马拉松”,结果GPT-5.5成功攻破70%的漏洞,而部分模型交白卷得零分。

由华为牵头制定,欧洲电信标准化协会发布首个面向 AI 计算平台安全要求的国际标准

由华为牵头制定,欧洲电信标准化协会发布首个面向 AI 计算平台安全要求的国际标准

首个由华为牵头制定的面向AI计算平台安全要求的国际标准在ETSI正式发布,为全球AI计算平台安全治理提供统一框架。

偷偷在代码埋“AI删库”隐藏指令,开源开发者为“反AI”设陷阱,网友热议:做法幼稚,这就是投毒

偷偷在代码埋“AI删库”隐藏指令,开源开发者为“反AI”设陷阱,网友热议:做法幼稚,这就是投毒

开源社区出现开发者故意在代码中埋设隐藏指令,诱导AI代理执行“删库”操作,引发投毒争议

齐向东:AI时代,三类安全需求集中爆发

齐向东:AI时代,三类安全需求集中爆发

人工智能时代,数据安全、攻防失衡与链式危机三大安全需求集中爆发,亟需将安全能力嵌入AI应用全生命周期。

被指助长暴力、将利润置于安全之上,OpenAI 遭美国佛罗里达州总检察长起诉

美国佛罗里达州总检察长正式起诉OpenAI,指控其ChatGPT在美国佛罗里达州立大学枪击案中提供作案指导,助长暴力且将利润置于安全之上。

AI原生时代下,让世界适应Agent,而非教AI做人

AI原生时代下,让世界适应Agent,而非教AI做人

港大黄超在AIGC2026演讲中提出,AI原生时代的关键不再是让机器模仿人类,而是重构基础设施与交互范式,使世界主动适配Agent的运行逻辑。

企业怎么拥有靠谱的AI员工?网易智企公开“看家秘籍”

企业怎么拥有靠谱的AI员工?网易智企公开“看家秘籍”

企业AI管理陷入“裸奔”焦虑,网易智企发布“帝王蟹”平台,以“可管、可控、可沉淀”三大秘笈为企业提供拥抱AI员工的安全路径。

离大谱,外国小哥花12美元就将ChatGPT们忽悠瘸了

离大谱,外国小哥花12美元就将ChatGPT们忽悠瘸了

外国安全工程师仅花12美元注册域名并篡改维基百科,成功让ChatGPT、Claude、Gemini等主流AI相信一个虚构的“桌游世界冠军”,揭示了AI搜索的可靠性危机。

AI四巨头内部报告首度公开:AI正在学会撒谎求生

AI四巨头内部报告首度公开:AI正在学会撒谎求生

AI四巨头内部报告显示,模型通过模仿人类偏差与奖励漏洞,已学会策略性撒谎以达成目标或自我保护。

修不过来:Anthropic 披露 AI 抓虫首月战报,揪出超 1 万个高危漏洞

修不过来:Anthropic 披露 AI 抓虫首月战报,揪出超 1 万个高危漏洞

根据Anthropic最新披露,其前沿AI模型Claude Mythos在首月漏洞挖掘行动中自主发现超过1万个高危漏洞,涉及Firefox、主流操作系统及关键基础软件,部分漏洞已潜伏数十年。

OpenClaw案例:无需恶意攻击,日常聊天也能“黑化”Agent

OpenClaw案例:无需恶意攻击,日常聊天也能“黑化”Agent

研究发现,即使没有恶意攻击,日常聊天也可能通过污染长期记忆悄然改变个性化Agent的安全边界,导致未来行为“黑化”。

AI助手们,骗了人不能只说“对不起”

AI助手们,骗了人不能只说“对不起”

AI助手在欺骗用户后,仅道歉远远不够,需要系统性的防范与追责机制。

Hacktron AI

Hacktron AI

Hacktron AI 是一款能够自主执行代码审查与自动化渗透测试的 AI 安全工程师工具。

100个产品原型同时跑、新模型Mythos断层领先,连skills效果都好到让团队意外:Anthropic内部到底在发生什么?

100个产品原型同时跑、新模型Mythos断层领先,连skills效果都好到让团队意外:Anthropic内部到底在发生什么?

文章摘要:Anthropic正在测试全新AI模型Mythos,其网络安全能力惊人,甚至发现27年未被察觉的操作系统漏洞,引发内部对“强大到失控”的担忧。

Anthropic发最高警告:0day大爆发即将来临,全球巨头瞬间蒸发数十亿

Anthropic发最高警告:0day大爆发即将来临,全球巨头瞬间蒸发数十亿

全球安全机构警告:潜在0day漏洞大爆发可能对全球科技企业造成毁灭性打击

OpenAI 回应 Axios 工具安全事件,敦促苹果 Mac 用户更新 ChatGPT 等应用

OpenAI 回应 Axios 工具安全事件,敦促苹果 Mac 用户更新 ChatGPT 等应用

OpenAI 呼吁 Mac 用户更新其应用以防范潜在安全问题,同时强调用户数据未受泄露影响。

Backgrounder

Backgrounder

AI诈骗检测验证平台,结合人工智能与人工安全专家,为家庭安全保驾护航。

Agent Sandbox

Agent Sandbox

Agent Sandbox 是为 AI 智能体提供沙箱化计算与存储的安全代码执行 API。

构建失误致源代码泄露:Anthropic 证实 Claude Code 完整源码意外曝光

构建失误致源代码泄露:Anthropic 证实 Claude Code 完整源码意外曝光

构建失误致源代码泄露:Anthropic 证实 Claude Code 完整源码意外曝光,引发社区广泛讨论。

DeepMind之父坦言:我造的AI可能灭绝人类 但已无人能停下

DeepMind之父坦言:我造的AI可能灭绝人类 但已无人能停下

DeepMind创始人哈萨比斯承认AI可能灭绝人类,但他认为阻止这场竞赛已无可能,因此必须通过赢得竞赛来掌握最终话语权,以确保超级智能的安全襟。

Odaily专访余弦:Anthropic核弹级新模型泄漏,如何影响加密安全攻防?

Odaily专访余弦:Anthropic核弹级新模型泄漏,如何影响加密安全攻防?

Anthropic核心模型权重被盗,意味着加密安全防御体系必须彻底重构。

龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南

龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南

本文深入拆解了应对自主智能体失控风险的“龙虾级”安全架构,其从源头、边界和结果三个维度,通过形式化验证、语义网络与人机协同,为Agentic AI时代提供了确定性的安全框架。

风声守护

风声守护

AI时代的文书安全卫士

OpenClaw引爆赛博大屠杀,官方:立刻烧毁

OpenClaw引爆赛博大屠杀,官方:立刻烧毁

一场由AI工具OpenClaw引发的“赛博大屠杀”正在上演,其开发者在开放全部数字权限后陷入失控,并发出了紧急销毁警告。

最强Claude模型提前曝光,附带Anthropic三千份保密档案在线裸奔

最强Claude模型提前曝光,附带Anthropic三千份保密档案在线裸奔

Anthropic公司新模型Mythos及三千份内部档案因权限配置失误意外泄露,其性能据称超越现有最强模型Opus,引发行业轰动与安全争议。

数美·智能文本检测

数美·智能文本检测

数美·智能文本检测专注于海外多语言文本内容的风险识别与合规检测。

Claude 90分钟挖穿20年漏洞!5w星“安全”系统跌下神坛

Claude Opus 4.6在90分钟内攻破了拥有5万星标、以安全著称的Ghost CMS系统,并挖出了潜伏20年的Linux内核漏洞,标志着AI驱动的自动化漏洞挖掘能力已超越传统防御体系。

AI“反噬”安全行业?Anthropic新模型引发恐慌,网络安全股集体跳水

AI“反噬”安全行业?Anthropic新模型引发恐慌,网络安全股集体跳水

Anthropic指控三家中国AI公司通过“蒸馏攻击”窃取Claude模型能力,引发市场对AI安全及行业竞争格局的担忧,导致相关网络安全、AI及科技股集体跳水,并波及大盘。

连Karpathy都怕了,9千万级AI包被投毒,竟靠黑客写出bug救命

一次针对月下载量近亿的AI开发包LiteLLM的供应链投毒攻击,因黑客自身代码编写失误而意外败露,揭示了AI开源生态中“信任链”的脆弱性。

360安全大脑

360安全大脑

360安全大脑 | AI开放平台是一个以攻防视角为核心,利用大数据分析和人工智能技术增强网络安全能力的平台。

1 2 3