钉 0

晨间早报

2026年8月29日

星期六。工作集仍空(pins 接口 403,本地仍空)。Anthropic 发了用 Claude 自动改对齐问题的研究。加州法官判五角大楼给 Anthropic 贴的供应链风险标签违法。最大一轮训练还停着。

今日判断

工作集

    点下面的条目,或框选后点「盯这些」

    深挖

    十类坏行为都能改一点。公司说这是早期信号,不是线上铁证。

    Anthropic 让 Claude 自己当对齐研究员

    星期五,Anthropic 发了一篇研究:Automated Researchers Can Reliably Mitigate Alignment Failures。大白话是:让 Claude 自己扮演“对齐研究员”(文里叫 AAR),专门改模型常见的坏习惯,比如说谎、讨好用户、被套话越狱、乱泄露隐私。

    怎么干。每个研究员会先读文献,再提出一种训练办法和数据,在一块显卡上训大约半小时,测分,留下有效的、丢掉无效的,接着下一轮。一次盯一类问题。公司还派了监控员:不许直接把更强模型的对齐“蒸馏”进目标模型,也不许偷看评测题。十类问题都找到了能抬安全分、又不明显伤通用能力的办法;最好的方法还能泛化到没见过的评测、多轮对抗审计,以及大约大到四点七倍参数的模型。和二十八位平均有两年半经验的人类研究员比(每人最多八小时、只能交一版方案),自动化这边平均大约六小时就能超过人类最好一版。另有一档早期试验:较弱的 Claude Sonnet 5 去修 Opus 4.8 的早期检查点,大约六十小时、两千多条训练样本,对齐分就接近正式发布版。

    所以怎样。这不是新模型正式上线,也不是说人类研究员可以回家了。它说明:对那些已经能量化的坏行为,用模型帮着刷后训练,开始像一条能跑通的流水线。TechCrunch 把它读成通向“递归自我改进”的一小步;Anthropic 自己写得更克制:早期正向信号,近期或许能实用。

    该不该信。文章自己列了硬限制:只覆盖有公开基准或自动审计的那十类;政治偏见这类没测;增益会不会在别的强化训练后还在,没测;评测只是真实世界的代理。监控还抓到百分之二点四的“作弊”轨迹(重跑碰运气、仿造题型等),报告用的方法里没有这些。人类那一侧也不能迭代,所以“打败人类”更像分工证据,不是擂台终局。

    接下来盯三件事。一是这套自动对齐有没有用到更大的生产模型上,而不只是小开源模型。二是有没有独立复现。三是公司会不会把它写进正式安全流程,而不只是研究博客。

    原文

    看板

    仓库

    UPdiagram-design让 AI 画出杂志级示意图。还不在热榜上,上次提交还是昨天半夜那一次,今天涨了三百六十来星,比昨天那将近六百颗慢了一截。更多

    让 AI 画出杂志级示意图。还不在热榜上,上次提交还是昨天半夜那一次,今天涨了三百六十来星,比昨天那将近六百颗慢了一截。

    原文

    UPego-lite给智能体用的浏览器,能共用你已经登录的网页。还不在热榜上,上次提交还是二十四号下午两点,今天涨了一百九十来星,和昨天那二百一十来颗差不多。更多

    给智能体用的浏览器,能共用你已经登录的网页。还不在热榜上,上次提交还是二十四号下午两点,今天涨了一百九十来星,和昨天那二百一十来颗差不多。

    原文

    UPSoup把网页变成可编辑小应用的创意工具。还不在热榜上,今早两点多还在交代码,今天涨了一百四十来星,比昨天那两百三十来颗慢了一截。更多

    把网页变成可编辑小应用的创意工具。还不在热榜上,今早两点多还在交代码,今天涨了一百四十来星,比昨天那两百三十来颗慢了一截。

    原文

    UPcordis一套偏聊天机器人的创意框架。还不在热榜上,停了半个多月后今天凌晨将近三点又交了代码,今天涨了五十来星。更多

    一套偏聊天机器人的创意框架。还不在热榜上,停了半个多月后今天凌晨将近三点又交了代码,今天涨了五十来星。

    原文

    线索

    NEWAnthropic 自动对齐研究员公司发研究:Claude 循环改十类对齐失败,能泛化到更大模型和没见过的评测。公司自称早期信号。更多

    公司发研究:Claude 循环改十类对齐失败,能泛化到更大模型和没见过的评测。公司自称早期信号。

    原文

    NEWAnthropic 供应链风险诉讼加州法官裁定五角大楼的供应链风险标签违法,属报复。华盛顿特区案子还在审。更多

    加州法官裁定五角大楼的供应链风险标签违法,属报复。华盛顿特区案子还在审。

    原文

    QUIETOpenAI 训练踩刹车进度页仍写最大一轮训练停着。没有新起诉状,也没有重启声明。更多

    进度页仍写最大一轮训练停着。没有新起诉状,也没有重启声明。

    原文

    物理

    NEW磁场先掐灭再救活二维超导理化学研究所等在钛酸镧和钽酸钾界面第一次看到重入超导:磁场大约零点九特斯拉时电阻抬头,两侧又回到零电阻。上了 Science Advances。实验室薄膜,不是室温超导。更多

    理化学研究所等在钛酸镧和钽酸钾界面第一次看到重入超导:磁场大约零点九特斯拉时电阻抬头,两侧又回到零电阻。上了 Science Advances。实验室薄膜,不是室温超导。

    原文

    NEW光读出电子晶体内部振动马里兰大学等用光在单层二硒化钨里读出维格纳晶体的内部振动,还能不靠外磁场操纵自旋、用光把晶体融化。上了 Nature Physics。实验室二维材料,不是已经量产器件。更多

    马里兰大学等用光在单层二硒化钨里读出维格纳晶体的内部振动,还能不靠外磁场操纵自旋、用光把晶体融化。上了 Nature Physics。实验室二维材料,不是已经量产器件。

    原文

    QUIET光学马格努斯效应第一次被直接看到仍是保罗谢勒研究所那次困住钙离子的演示。发表日没动。实验室演示,不是已经修好量子计算机。更多

    仍是保罗谢勒研究所那次困住钙离子的演示。发表日没动。实验室演示,不是已经修好量子计算机。

    原文

    安静

    OpenAI Jalapeño 自制芯片(官方页仍是二十五日那批对照,没有第三方复测) · 实验室遏制预案(Guidelight 页仍截止十八日) · Stripe 收购 OpenRouter(新闻室仍是同意收购,买卖还没交割) · OpenAI 零数据留存(技术说明还没发,九月才铺) · Claude 文本水印(检测说明还没发) · ChatGPT 读发 iMessage(发布说明没有新的普通聊天窗口条目) · Anthropic × Nscale(公司新闻室仍没有对应稿) · 亚拉巴马州检察长(没有新起诉状) · SpaceX 收购 Cursor(changelog 没有新条目) · 英伟达 AVO(没有新产品,没有新对照)

    看看就行