【主题】OpenAI称已达“自动化研究实习生”:代理工时超过人力
解读 OpenAI 发布内部报告称,按自设标准已达到“自动化研究实习生”里程碑:能在人工指导下完成原本要花熟练研究员数天的明确任务,下一目标是2028年3月前后的全自动研究者。同期首席科学家警告:各实验室的对齐与监控还不够支撑继续全速放大。对工程师来说,别把“代理很能干”直接等同“可以无人值守”——先把验收清单、审计日志和回滚开关写进流程。
来源 THE DECODER
6 条当日/近期热点 · 工程师向浅科普
解读 OpenAI 发布内部报告称,按自设标准已达到“自动化研究实习生”里程碑:能在人工指导下完成原本要花熟练研究员数天的明确任务,下一目标是2028年3月前后的全自动研究者。同期首席科学家警告:各实验室的对齐与监控还不够支撑继续全速放大。对工程师来说,别把“代理很能干”直接等同“可以无人值守”——先把验收清单、审计日志和回滚开关写进流程。
来源 THE DECODER
解读 Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1:同一底座、不同安全挡位。Fable 面向通用平台并把缓存读取降价约75%,这对长会话 Agent 账单影响很大;Mythos 则面向经审核的网络安全与生命科学场景。选型时别只看编码榜,先算缓存命中后的真实成本,再确认数据是否能留在你可控的环境。
来源 Anthropic
解读 Meta 开源 MoE-ViE(ECCV 2026):把 Mixture-of-Experts 用到视觉编码,提供 B/L/H 三档,面向分类与图文/视频检索。它不是聊天大模型,更像高效视觉底座。若你在做多模态检索或视频理解,可先拿公开权重做吞吐与召回对比,再决定要不要替换现有 CLIP 系编码器。
解读 Psi-0 是面向灵巧人形loco-manipulation 的开源视觉-语言-动作模型:先吃大规模第一人称人类视频,再用少量遥操作数据对齐真机。团队称新技能可低至约80条轨迹微调。对机器人工程:关键不是演示视频,而是数据采集配方、全身跟踪控制器与安全护栏能否复现。
解读 京东开源方向的 JoyAI-Image 把图像理解、文生图与指令编辑放进同一套多模态架构,并持续补齐 Diffusers / ComfyUI 工作流。对落地团队,价值在“改图指令能否稳定落到空间关系”,而不是再堆一个文生图分数。可先用编辑工作流做内部素材试验,再评估商用许可与延迟。
来源 GitHub / JD
解读 NVIDIA Eagle 仓库持续更新 LocateAnything:把视觉语言 grounding 做成更通用的“按描述找位置”能力,并补齐非 Hopper GPU 上的高效推理路径。对 CV 应用:货架盘点、工业点检、具身抓取前的目标定位都能直接受益。上手时先验证小样本域偏移,再谈是否替换专用检测头。