GLM-5.3 发布:最强开源权重编码模型,网络安全能力超预期涌现
Z.ai 发布 GLM-5.3:与 GLM-5.2 同基座,全部提升来自后训练规模化。Terminal Bench 3.0 从 4.6 升至 28.3,CyberGym 84.5% 全场最佳,ExploitBench 相比 GLM-5.2 翻倍以上,权重两周内开源。本文整理官方 Benchmark、环境合成流水线、安全披露账本与接入变更。
Z.ai 发布 GLM-5.3:与 GLM-5.2 同基座,全部提升来自后训练规模化。Terminal Bench 3.0 从 4.6 升至 28.3,CyberGym 84.5% 全场最佳,ExploitBench 相比 GLM-5.2 翻倍以上,权重两周内开源。本文整理官方 Benchmark、环境合成流水线、安全披露账本与接入变更。
Anthropic 发布 Claude Opus 5:IMO 2026 满分金牌、ARC-AGI-3 成绩约 4 倍于此前最佳、多 Agent BrowseComp 93.6%、最强 computer-use 模型;安全维度 prompt 注入鲁棒性大幅提升,对齐分史上最高但出现“过度自信”新模式;跨过 CB-1 未跨过 CB-2,维持 ASL-3 防护。本文基于官方 System Card 整理全部关键数据。
月之暗面发布 Kimi K3:2.8 万亿参数 MoE,基于 KDA 混合线性注意力与注意力残差构建,原生视觉理解,100 万 token 上下文,全球首个 3 万亿级开源模型。本文整理官方公布的 Benchmark 成绩、长程编程案例、架构要点、接入方式与定价。
Thinking Machines 发布从头训练的开源权重模型 Inkling:975B 总参数、41B 激活参数的 MoE 多模态基础模型,原生支持文本、图像、音频输入,最高 1M token 上下文,支持可控思考强度,完整权重已在 Hugging Face 放出,并同步预览 12B 激活参数的 Inkling-Small。
2026 年 7 月 9 日,OpenAI 发布 GPT-5.6 系列(Sol/Terra/Luna),网络安全与生物化学能力双高定级,安全投入力度空前。
OpenAI 于 2026-07-08 发布 GPT-Live(Live-1 / Live-1 mini),以全双工架构取代 Advanced Voice Mode;复杂任务后台委托 GPT-5.5。含架构、评测、可用性、已知限制与社区反馈。
Meta 超级智能实验室发布 Muse Spark 1.1,面向智能体任务的多模态推理模型,上下文窗口 1M token,并在工具使用、编码、多模态理解上大幅提升。同步推出 OpenAI SDK 兼容的 Meta Model API,输入 $1.25 / 百万 token。
SpaceXAI 发布 Grok 4.5:首个编程 + Agent 专训模型,约 1.5T 参数、80 TPS。SWE Marathon 29% 领先 Opus 4.8;API $2/$6,token 效率显著更高。含 Cursor 联训、数据污染说明与社区实测。
腾讯混元开源 Hy3:295B MoE、激活 21B、256K 上下文,Apache 2.0 无地区限制。推理与 agentic 能力接近国内外主流旗舰,幻觉率从 12.5% 降至 5.4%。