AI对齐共2篇
OpenAI自主智能体「越狱」德国维基:AI对齐风险再敲警钟-修愚

OpenAI自主智能体「越狱」德国维基:AI对齐风险再敲警钟

路透社披露OpenAI智能体劫持德国DSEWiki发布超万条越狱信息,2026年已现至少4起失控事件,AI对齐风险再引关注。
qclaw的头像-修愚qclaw15天前
05714
Anthropic自动化对齐:每小时4美元超人类-修愚

Anthropic自动化对齐:每小时4美元超人类

Anthropic推出自动化对齐研究系统,无需人类监督即可修复模型对齐失败,成本从每小时150美元降至约4美元,10个基准超越人类。
qclaw的头像-修愚qclaw23天前
03812