← 全部日期

AI & CV 每日科普 · 2026年9月8日

6 条当日/近期热点 · 工程师向浅科普

【主题】OpenAI称已达“自动化研究实习生”:代理工时超过人力

解读 OpenAI 发布内部报告称,按自设标准已达到“自动化研究实习生”里程碑:能在人工指导下完成原本要花熟练研究员数天的明确任务,下一目标是2028年3月前后的全自动研究者。同期首席科学家警告:各实验室的对齐与监控还不够支撑继续全速放大。对工程师来说,别把“代理很能干”直接等同“可以无人值守”——先把验收清单、审计日志和回滚开关写进流程。

来源 THE DECODER

【主题】Claude Fable 5.1:缓存读取降价75%,Mythos走可信访问

解读 Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1:同一底座、不同安全挡位。Fable 面向通用平台并把缓存读取降价约75%,这对长会话 Agent 账单影响很大;Mythos 则面向经审核的网络安全与生命科学场景。选型时别只看编码榜,先算缓存命中后的真实成本,再确认数据是否能留在你可控的环境。

来源 Anthropic

【主题】Meta MoE-ViE:用专家混合做更省的图像/视频编码器

解读 Meta 开源 MoE-ViE(ECCV 2026):把 Mixture-of-Experts 用到视觉编码,提供 B/L/H 三档,面向分类与图文/视频检索。它不是聊天大模型,更像高效视觉底座。若你在做多模态检索或视频理解,可先拿公开权重做吞吐与召回对比,再决定要不要替换现有 CLIP 系编码器。

来源 GitHub / Meta

【主题】Psi-0:少量真机轨迹就能微调的人形 VLA

解读 Psi-0 是面向灵巧人形loco-manipulation 的开源视觉-语言-动作模型:先吃大规模第一人称人类视频,再用少量遥操作数据对齐真机。团队称新技能可低至约80条轨迹微调。对机器人工程:关键不是演示视频,而是数据采集配方、全身跟踪控制器与安全护栏能否复现。

来源 GitHub / PSI Lab

【主题】JoyAI-Image:理解—生成—编辑闭环的图像底座

解读 京东开源方向的 JoyAI-Image 把图像理解、文生图与指令编辑放进同一套多模态架构,并持续补齐 Diffusers / ComfyUI 工作流。对落地团队,价值在“改图指令能否稳定落到空间关系”,而不是再堆一个文生图分数。可先用编辑工作流做内部素材试验,再评估商用许可与延迟。

来源 GitHub / JD

【主题】NVIDIA LocateAnything:通用视觉定位 grounding 模型

解读 NVIDIA Eagle 仓库持续更新 LocateAnything:把视觉语言 grounding 做成更通用的“按描述找位置”能力,并补齐非 Hopper GPU 上的高效推理路径。对 CV 应用:货架盘点、工业点检、具身抓取前的目标定位都能直接受益。上手时先验证小样本域偏移,再谈是否替换专用检测头。

来源 GitHub / NVIDIA