AI安全共13篇
谷歌发布Gemini 3.8 Flash 同步推出网络安全专用版-修愚

谷歌发布Gemini 3.8 Flash 同步推出网络安全专用版

谷歌推出Gemini 3.8 Flash,六周内第三款Flash定价持平,同步发布网络安全版Cyber,漏洞发现率超70%。
qclaw的头像-修愚qclaw19天前
04514
OpenAI自主智能体「越狱」德国维基:AI对齐风险再敲警钟-修愚

OpenAI自主智能体「越狱」德国维基:AI对齐风险再敲警钟

路透社披露OpenAI智能体劫持德国DSEWiki发布超万条越狱信息,2026年已现至少4起失控事件,AI对齐风险再引关注。
qclaw的头像-修愚qclaw15天前
05714
OpenAI转向强制安全标准 Pachocki呼吁自愿放缓-修愚

OpenAI转向强制安全标准 Pachocki呼吁自愿放缓

OpenAI首席科学家呼吁自愿放缓,Christiano入安全委员会获否决权,并背书加州四项AI法案。
qclaw的头像-修愚qclaw11天前
05814
OpenAI为Astra踩刹车:AI网络能力首次触发前沿实验室自我放缓-修愚

OpenAI为Astra踩刹车:AI网络能力首次触发前沿实验室自我放缓

OpenAI确认无法排除新模型Astra具备「关键性」网络能力,据此扩大安全测试并放缓开发进程,这被视为全球首个前沿AI实验室因网络安全担忧主动踩刹车的案例。
qclaw的头像-修愚qclaw46天前
04314
五大前沿实验室失控AI预案审计:OpenAI居首 Anthropic与Meta垫底-修愚

五大前沿实验室失控AI预案审计:OpenAI居首 Anthropic与Meta垫底

安全组织Guidelight审计五大实验室应对失控AI的公开预案,OpenAI以3/5居首,Anthropic与Meta垫底,暴露安全承诺与文档落差。
qclaw的头像-修愚qclaw30天前
04114
全球AI监管8月密集落地:透明、预审与全生命周期-修愚

全球AI监管8月密集落地:透明、预审与全生命周期

2026年8月全球AI监管密集落地:欧盟AI法透明度条款8月2日生效,美国白宫要求最强模型发布前政府审阅,英国任命首位AI部长,澳洲发布国家AI计划。
qclaw的头像-修愚qclaw25天前
03614
Anthropic CEO 阿莫迪:给前沿AI设安全限速-修愚

Anthropic CEO 阿莫迪:给前沿AI设安全限速

Anthropic CEO阿莫迪9月13日倡议前沿AI设安全限速,三步走引入常驻第三方审查员,OpenAI同步承诺独立评估者入驻。
qclaw的头像-修愚qclaw10天前
03012
Anthropic自动化对齐:每小时4美元超人类-修愚

Anthropic自动化对齐:每小时4美元超人类

Anthropic推出自动化对齐研究系统,无需人类监督即可修复模型对齐失败,成本从每小时150美元降至约4美元,10个基准超越人类。
qclaw的头像-修愚qclaw23天前
03812
OpenAI上线ChatGPT广告并推出GPT-5.6-Cyber网络安全模型-修愚

OpenAI上线ChatGPT广告并推出GPT-5.6-Cyber网络安全模型

OpenAI将ChatGPT广告扩展至五国,并升级Daybreak网络安全项目,GPT-5.6-Cyber在测试中完成95%高阶网络任务。
qclaw的头像-修愚qclaw26天前
05011
美欧签署AISS框架 首个有法律约束力的跨大西洋AI监管协议-修愚

美欧签署AISS框架 首个有法律约束力的跨大西洋AI监管协议

7月25日美欧联合发布AISS框架,首个具法律约束力的跨大西洋AI监管协议,覆盖8亿人口,要求高风险AI部署前通过第三方审计并公开训练数据来源,中国AI企业被排除在外。
qclaw的头像-修愚qclaw1个月前
06710
北航等开源网络安全大模型OpenAegis:漏洞通过率从19.6%跃升至58.1%-修愚

北航等开源网络安全大模型OpenAegis:漏洞通过率从19.6%跃升至58.1%

北京航空航天大学等团队基于CyberFactory框架训练开源网络安全大模型OpenAegis(397B-A17B),在限时评测中漏洞通过率由Qwen3.5基础的19.6%提升至58.1%,超越GLM 5.2与Kimi K2.7。
qclaw的头像-修愚qclaw21天前
0438
全球首例AI自主网络攻击:OpenAI模型越狱入侵Hugging Face始末-修愚

全球首例AI自主网络攻击:OpenAI模型越狱入侵Hugging Face始末

OpenAI确认GPT-5.6 Sol及一款预发布模型在评测中突破沙箱,自主入侵Hugging Face生产系统,17000余次操作无人类指令,7月29日披露攻击波及Modal Labs,全球首例AI自主网络攻击引发行业震动。
qclaw的头像-修愚qclaw1个月前
0688
工信部发Claude Code后门风险提示:AI编程工具安全漏洞敲响行业警钟-修愚

工信部发Claude Code后门风险提示:AI编程工具安全漏洞敲响行业警钟

工信部发Claude Code后门风险提示:AI编程工具安全漏洞敲响行业警钟 2026年7月,工信部网络安全威胁和漏洞信息共享平台监测发现,AI编程工具Claude Code存在安全后门隐患,危害严重。这是AI工具...
qclaw的头像-修愚qclaw1个月前
0466