AI+ 2026-10-08

AI 行业快讯(2026-10-08):数学突破开源、GPT-6 普惠、agent 上岗、谷歌开源多模态嵌入

1. OpenAI 前沿模型攻克一批数学开放问题,证明过程全开源(10/6)

OpenAI 发布《Sharing AI progress in mathematics》:内部前沿模型在多个数学开放问题上产出了新的结果,并做了两件让学界侧目的事——所有证明提供 Lean 形式化(可被机器独立验证,杜绝「模型自说自话」),全部内容连同推理摘要、算力开销一并放上 GitHub 供复核。

发布规范由与普林斯顿高等研究院(IAS)合作的「数学与 AI 顾问组」参与制定,透明度细节包括:模型尝试与放弃的问题统计、平均每个结果约相当于 3 小时 ChatGPT Pro 级别的思考算力。OpenAI 还承诺资助系列学术研讨会,并表示将在适当时候公布产出这些结果的模型。

这条冲上 Hacker News 首页榜首(1225 分)。对企业的意义不在数学本身,而在验证范式:高价值 AI 产出+形式化验证+全量公开可复核——这套组合正是企业接受 agent 产出所缺的信任基础设施。

2. GPT-6 全量开放至免费档,自带「智能 UI」(10/7)

OpenAI 宣布 GPT-6 向全球所有用户推送:免费档与 Go 套餐默认使用 GPT-6 Luna,付费档(Plus/Pro/Business/Enterprise)使用 GPT-6 Sol——9 月 22 日发布的 GPT-6 系列至此完成全量覆盖。

同步上线的还有 Intelligent UI:回答响应更快,且以可视化、可交互的组件呈现(不再只是文本流),用户可直接在对话中操作结果。模型竞争进入「交互形态」竞争阶段——对企业选型的参考点:评估 AI 产品时,交互集成能力(能否嵌入业务界面)正在成为与模型分数同级的考量。

3. OpenAI × Ironclad:agent 考「专业执照」,合同流程自动化冲线(10/6)

OpenAI 与合同管理平台 Ironclad 合作,用真实的专业合同工作流训练与评估 agent(项目名 Ironclad):从文件阅读、条目录入到多步骤流程执行。基准对比中,GPT-6 Astra 得分 55.0%,上一代 GPT-5.6 Sol 为 41.6%。

这类「专业岗位模拟测试」的堆叠(此前已有 CRM 录入、文档处理),正在系统性回答企业最关心的问题:agent 什么时候能接手真实业务流程。合同管理、财务录入这类高重复、有明确正确性的岗位,已是第一批答案。

4. 谷歌开源多模态嵌入模型 EmbeddingGemma 2(10/6-7)

Google DeepMind 发布开放权重嵌入模型 EmbeddingGemma 2:约 740M 参数(另有更小的变体),把文本、代码、图像、视频、音频统一映射到同一向量空间,以 Apache 2.0 开源,目标是直接跑在手机等端侧设备上。同期谷歌还发布了图像生成模型 Nano Banana 2.1 的升级版。

嵌入模型是检索增强(RAG)、语义搜索、去重分类的地基。此前多模态检索往往要为每种模态各配一个模型再拼接结果;统一向量空间意味着一套索引管所有内容类型。对企业,740M 的体积+开放权重让「数据不出内网的本地语义检索」又轻了一截——FileMaker 用户做文档知识库检索时,这也是值得关注的本地化选项。


综合 OpenAI 官方博客、Anthropic 官方公告、Google DeepMind 公告与 Hacker News 社区信号。

继续阅读