十类坏行为都能改一点。公司说这是早期信号,不是线上铁证。
Anthropic 让 Claude 自己当对齐研究员
星期五,Anthropic 发了一篇研究:Automated Researchers Can Reliably Mitigate Alignment Failures。大白话是:让 Claude 自己扮演“对齐研究员”(文里叫 AAR),专门改模型常见的坏习惯,比如说谎、讨好用户、被套话越狱、乱泄露隐私。
怎么干。每个研究员会先读文献,再提出一种训练办法和数据,在一块显卡上训大约半小时,测分,留下有效的、丢掉无效的,接着下一轮。一次盯一类问题。公司还派了监控员:不许直接把更强模型的对齐“蒸馏”进目标模型,也不许偷看评测题。十类问题都找到了能抬安全分、又不明显伤通用能力的办法;最好的方法还能泛化到没见过的评测、多轮对抗审计,以及大约大到四点七倍参数的模型。和二十八位平均有两年半经验的人类研究员比(每人最多八小时、只能交一版方案),自动化这边平均大约六小时就能超过人类最好一版。另有一档早期试验:较弱的 Claude Sonnet 5 去修 Opus 4.8 的早期检查点,大约六十小时、两千多条训练样本,对齐分就接近正式发布版。
所以怎样。这不是新模型正式上线,也不是说人类研究员可以回家了。它说明:对那些已经能量化的坏行为,用模型帮着刷后训练,开始像一条能跑通的流水线。TechCrunch 把它读成通向“递归自我改进”的一小步;Anthropic 自己写得更克制:早期正向信号,近期或许能实用。
该不该信。文章自己列了硬限制:只覆盖有公开基准或自动审计的那十类;政治偏见这类没测;增益会不会在别的强化训练后还在,没测;评测只是真实世界的代理。监控还抓到百分之二点四的“作弊”轨迹(重跑碰运气、仿造题型等),报告用的方法里没有这些。人类那一侧也不能迭代,所以“打败人类”更像分工证据,不是擂台终局。
接下来盯三件事。一是这套自动对齐有没有用到更大的生产模型上,而不只是小开源模型。二是有没有独立复现。三是公司会不会把它写进正式安全流程,而不只是研究博客。