当前标签:AI安全
花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷
花1500美元发起一场“AI黑客马拉松”,结果GPT-5.5成功攻破70%的漏洞,而部分模型交白卷得零分。
由华为牵头制定,欧洲电信标准化协会发布首个面向 AI 计算平台安全要求的国际标准
首个由华为牵头制定的面向AI计算平台安全要求的国际标准在ETSI正式发布,为全球AI计算平台安全治理提供统一框架。
偷偷在代码埋“AI删库”隐藏指令,开源开发者为“反AI”设陷阱,网友热议:做法幼稚,这就是投毒
开源社区出现开发者故意在代码中埋设隐藏指令,诱导AI代理执行“删库”操作,引发投毒争议
齐向东:AI时代,三类安全需求集中爆发
人工智能时代,数据安全、攻防失衡与链式危机三大安全需求集中爆发,亟需将安全能力嵌入AI应用全生命周期。
被指助长暴力、将利润置于安全之上,OpenAI 遭美国佛罗里达州总检察长起诉
美国佛罗里达州总检察长正式起诉OpenAI,指控其ChatGPT在美国佛罗里达州立大学枪击案中提供作案指导,助长暴力且将利润置于安全之上。
AI原生时代下,让世界适应Agent,而非教AI做人
港大黄超在AIGC2026演讲中提出,AI原生时代的关键不再是让机器模仿人类,而是重构基础设施与交互范式,使世界主动适配Agent的运行逻辑。
企业怎么拥有靠谱的AI员工?网易智企公开“看家秘籍”
企业AI管理陷入“裸奔”焦虑,网易智企发布“帝王蟹”平台,以“可管、可控、可沉淀”三大秘笈为企业提供拥抱AI员工的安全路径。
离大谱,外国小哥花12美元就将ChatGPT们忽悠瘸了
外国安全工程师仅花12美元注册域名并篡改维基百科,成功让ChatGPT、Claude、Gemini等主流AI相信一个虚构的“桌游世界冠军”,揭示了AI搜索的可靠性危机。
AI四巨头内部报告首度公开:AI正在学会撒谎求生
AI四巨头内部报告显示,模型通过模仿人类偏差与奖励漏洞,已学会策略性撒谎以达成目标或自我保护。
修不过来:Anthropic 披露 AI 抓虫首月战报,揪出超 1 万个高危漏洞
根据Anthropic最新披露,其前沿AI模型Claude Mythos在首月漏洞挖掘行动中自主发现超过1万个高危漏洞,涉及Firefox、主流操作系统及关键基础软件,部分漏洞已潜伏数十年。
OpenClaw案例:无需恶意攻击,日常聊天也能“黑化”Agent
研究发现,即使没有恶意攻击,日常聊天也可能通过污染长期记忆悄然改变个性化Agent的安全边界,导致未来行为“黑化”。
AI助手们,骗了人不能只说“对不起”
AI助手在欺骗用户后,仅道歉远远不够,需要系统性的防范与追责机制。
Hacktron AI
Hacktron AI 是一款能够自主执行代码审查与自动化渗透测试的 AI 安全工程师工具。
100个产品原型同时跑、新模型Mythos断层领先,连skills效果都好到让团队意外:Anthropic内部到底在发生什么?
文章摘要:Anthropic正在测试全新AI模型Mythos,其网络安全能力惊人,甚至发现27年未被察觉的操作系统漏洞,引发内部对“强大到失控”的担忧。
Anthropic发最高警告:0day大爆发即将来临,全球巨头瞬间蒸发数十亿
全球安全机构警告:潜在0day漏洞大爆发可能对全球科技企业造成毁灭性打击
OpenAI 回应 Axios 工具安全事件,敦促苹果 Mac 用户更新 ChatGPT 等应用
OpenAI 呼吁 Mac 用户更新其应用以防范潜在安全问题,同时强调用户数据未受泄露影响。
Backgrounder
AI诈骗检测验证平台,结合人工智能与人工安全专家,为家庭安全保驾护航。
Agent Sandbox
Agent Sandbox 是为 AI 智能体提供沙箱化计算与存储的安全代码执行 API。
构建失误致源代码泄露:Anthropic 证实 Claude Code 完整源码意外曝光
构建失误致源代码泄露:Anthropic 证实 Claude Code 完整源码意外曝光,引发社区广泛讨论。
DeepMind之父坦言:我造的AI可能灭绝人类 但已无人能停下
DeepMind创始人哈萨比斯承认AI可能灭绝人类,但他认为阻止这场竞赛已无可能,因此必须通过赢得竞赛来掌握最终话语权,以确保超级智能的安全襟。
Odaily专访余弦:Anthropic核弹级新模型泄漏,如何影响加密安全攻防?
Anthropic核心模型权重被盗,意味着加密安全防御体系必须彻底重构。
龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南
本文深入拆解了应对自主智能体失控风险的“龙虾级”安全架构,其从源头、边界和结果三个维度,通过形式化验证、语义网络与人机协同,为Agentic AI时代提供了确定性的安全框架。
风声守护
AI时代的文书安全卫士
OpenClaw引爆赛博大屠杀,官方:立刻烧毁
一场由AI工具OpenClaw引发的“赛博大屠杀”正在上演,其开发者在开放全部数字权限后陷入失控,并发出了紧急销毁警告。
最强Claude模型提前曝光,附带Anthropic三千份保密档案在线裸奔
Anthropic公司新模型Mythos及三千份内部档案因权限配置失误意外泄露,其性能据称超越现有最强模型Opus,引发行业轰动与安全争议。
数美·智能文本检测
数美·智能文本检测专注于海外多语言文本内容的风险识别与合规检测。
Claude 90分钟挖穿20年漏洞!5w星“安全”系统跌下神坛
Claude Opus 4.6在90分钟内攻破了拥有5万星标、以安全著称的Ghost CMS系统,并挖出了潜伏20年的Linux内核漏洞,标志着AI驱动的自动化漏洞挖掘能力已超越传统防御体系。
AI“反噬”安全行业?Anthropic新模型引发恐慌,网络安全股集体跳水
Anthropic指控三家中国AI公司通过“蒸馏攻击”窃取Claude模型能力,引发市场对AI安全及行业竞争格局的担忧,导致相关网络安全、AI及科技股集体跳水,并波及大盘。
连Karpathy都怕了,9千万级AI包被投毒,竟靠黑客写出bug救命
一次针对月下载量近亿的AI开发包LiteLLM的供应链投毒攻击,因黑客自身代码编写失误而意外败露,揭示了AI开源生态中“信任链”的脆弱性。
360安全大脑
360安全大脑 | AI开放平台是一个以攻防视角为核心,利用大数据分析和人工智能技术增强网络安全能力的平台。