← 全部日期

AI & CV 每日科普 · 2026年9月23日

6 条当日/近期热点 · 工程师向浅科普

【主题】OpenAI发布GPT-6 Sol与Luna:半价API,瞄准高频工作流

解读 GPT-6家族在Astra旗舰之外补上Sol(偏编码与复杂任务)和Luna(偏高通量抽取摘要)。公司称推理与缓存效率提升后,API价格较5.6促销价大约腰斩,并宣称事实性错误更少。对工程师,这更像“分层路由”机会:重任务继续走旗舰,批处理与内部工具先压测Sol/Luna的延迟、缓存命中和价格,再改默认模型。

来源 The Register

【主题】Anthropic推出Claude Opus 5.5:接近Fable表现,安全请求会分流

解读 Opus 5.5是Claude 5.5家族首发,官方称多数工作接近Fable 5.1,运行成本低于前代Opus,并强化网络与生物相关请求的安全路由。对落地团队,基准分之外要单独测:敏感提示是否被降到旧模型、能力会不会突然变弱。编码代理和长任务选型时,把“路由行为”写进回归清单。

来源 Anthropic

【主题】Meta为Muse测试“人类礼宾”代打电话:AI代理掺人要先讲清楚

解读 路透披露Meta让承包商悄悄接手部分Muse外呼,以提高订餐询价成功率,员工质疑隐私披露不足后功能回滚。这说明“Agent能打电话”不等于纯模型闭环。产品上线前要明确告知用户是否有人接入、数据如何留存;工程侧则要把人工接力当成独立权限与审计通道,而不是隐藏开关。

来源 CNA / Reuters

【主题】OpenAI成立AGMAI数学顾问组:科研成果披露也要有外部刹车

解读 在数学成果传播引发争议后,OpenAI组建独立数学顾问组AGMAI,可主动建言、公开评论,并早期接触相关研究。对做科研助手或自动写论文工具的团队,这意味着“模型会算”不够,还要设计外部审阅、声明口径与版本追溯。选型时也可把披露流程当成可信度指标。

来源 The Verge

【主题】VisionPsy-Nano开源:约460M端侧视觉语言模型,主打手机端多模态

解读 Tether AI Research放出VisionPsy-Nano系列,约4.6亿参数,分质量版与Flash低延迟版,并提供GGUF量化与llama.cpp路径。目标是把看图问答、图表文档理解搬到端侧,少走云。工程师可先在目标机型测首token延迟和显存/内存占用,再决定是否替换SmolVLM一类小模型。

来源 Hugging Face Blog

【主题】NVIDIA量化Muse-Glimmer-30B-NVFP4:多模态代理模型更易上消费级硬件

解读 Hugging Face上的NVFP4量化版面向交错图文输入的本地代理任务,强调工具调用与多步推理,单图视觉token上限较高。对想在工作站跑“看截图+点工具”代理的人,量化格式比追绝对参数量更关键:先确认推理框架是否支持NVFP4,再比同任务下的吞吐与失败恢复。

来源 Hugging Face / NVIDIA