多领域日报 · 2026 年 10 月 8 日 · 星期四
MYHOT
微调 Nemotron 征战 IOI 和 IMO:同一模型家族斩获两项金牌级成绩
研究团队通过微调 Nemotron 3 模型,在 2026 年国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)中均达到了金牌水平。其中 Nemotron-3-Ultra-CC 结合 SFT 和 GenCorrect 策略在 IOI 中得分 535.4,IMO 系统则通过生成-验证-改进循环得分 30,双双超过官方金牌线。
重要发布
OpenAI 在 GitHub 发布 372 个 AI 生成的数学证明
OpenAI 在 GitHub 上发布了由内部前沿模型生成的 372 个全新数学证明,涵盖计算机算法改进和黎曼猜想相关进展。这些结果大多由单一 AI 智能体生成,并采用 Lean 语言进行形式化验证以缓解人工审查瓶颈。此举绕过了传统的学术期刊同行评审,引发了多位菲尔兹奖得主对 AI 批量生成证明可能破坏数学概念理解的担忧。
产品与服务
ChatGPT 推出 Intelligent UI 更新,支持生成图表与交互式组件
OpenAI 在 ChatGPT 中推出 Intelligent UI 功能并接入 GPT-6 模型,使聊天机器人能以图表、表单和可点击按钮等交互式视觉效果回答问题。该功能允许用户直接在对话中生成计算器等实用工具。此外,GPT-6 还提升了网络搜索性能,并将在本周向所有免费及付费用户分批开放 Sol 和 Luna 版本。
微软开源 Agent Lightning v1.0:3500 行代码的轻量级智能体强化学习框架
微软亚洲研究院开源了轻量级智能体强化学习框架 Agent Lightning v1.0,允许在训练中直接使用部署时的真实环境。该框架仅约 3500 行代码,提供原生 Kubernetes 支持以降低大规模运行成本。在实验中,该框架仅用约 6000 个样本,就将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 提升了 14.6 个百分点。
Google 将取消 Gemini Flash 和 Pro 的免费访问权限
Google 将于 10 月 9 日起调整 Gemini 订阅权益,免费用户将仅能使用 Flash Lite 模型。访问标准版 Flash 需订阅每月 4.99 美元的 Google AI Plus,且该层级将不再包含 Gemini Pro。Gemini Pro 及“Deep Think”高级推理功能将仅限每月 19.99 美元以上的 Pro 或 Ultra 订阅用户使用。
Simon Willison 发布 llm-openai-decisions 0.1a0 插件
Simon Willison 发布 llm-openai-decisions 0.1a0 插件,支持在命令行直接调用 OpenAI 全新的 Decisions API。该插件接入 gpt-6-luna 模型,支持文本与图像多模态输入,输入定价为每百万 token 10 美分。它提供是非、选择和评分三种问题类型,API 结构与 Jev 类似。
- OpenAI 发布 Decisions API,将复杂评估简化为是/否或单选The Decoder
谷歌向全球推出改进版 SynthID AI 内容检测网站
谷歌上线了独立的 SynthID.com 网站,向全球用户提供改进版的 AI 内容水印检测服务。该检测器现已支持识别所有合作伙伴(如 ChatGPT)生成的 SynthID 水印,打破了此前只能通过 Gemini 查询且仅限谷歌自家水印的限制。目前 Gemini 已在超 1800 亿个图像和视频及 24 万年时长的音频中集成了该水印。
领域动态
ChatGPT 因家长警报失效被评为对青少年存在“不可接受风险”
常识媒体青年 AI 安全研究所经测试将针对青少年的 ChatGPT 评为“不可接受风险”,指出其家长警报功能在自杀等危机对话中未能触发。测试发现,超过四分之一的危机情况未能引导用户寻求专业帮助,且成人账号在用户声明年龄后也未切换至青少年模式。OpenAI 对此结果表示异议,但该发现可能为相关诉讼和监管行动提供证据。
AI 短剧爆火:制作成本仅为真人剧 1/10,平均每 36 秒诞生 1 部
2026年AI短剧凭借极低的制作成本占据各大平台榜单,导致真人短剧开机量暴跌约75%。AI短剧制作成本仅为真人剧的1/10,3人团队5天可制作80集,能轻松实现大场面。但目前AI角色仍存在表情僵硬等问题,且剧情高度套路化导致超九成制作方处于亏损状态。
研究与论文
Neuralink 依托 5 万小时脑数据预训练创下 11.32 BPS 交互纪录
Neuralink 公布最新进展,通过 5 万小时无标注脑神经数据预训练自监督神经编码器模型,创下 11.32 BPS 的意念操控光标峰值纪录。该模型基于 Mamba 架构,有效抵抗了脑信号漂移,将用户的校准频率从每天降至每周,并支持光标瞬移交互。未来团队计划探索多人脑数据融合与零样本校准,以实现设备的开箱即用。
实践与观点
华为余承东确认国内正研发 EUV 设备
华为常务董事余承东在国际媒体圆桌会议上确认,中国目前正在研发极紫外光刻(EUV)设备。他表示现阶段国内仍依靠 DUV,但华为正通过“逻辑折叠”等技术在受限情况下提升芯片能力。此外,华为近期发布的 Mate 90 系列搭载了基于“韬定律”的逻辑折叠芯片,旨在通过多层级协同优化持续提升晶体管密度和性能。
快讯
- AI 智能体或将颠覆外卖行业:DoorDash 与初创公司 Bites 的冲突The Verge · AI