腾讯混元 Hy3 正式发布:295B MoE、256K 上下文,开源 Apache 2.0

腾讯混元团队正式开源新模型 Hy3,并在 HuggingFace、ModelScope、GitCode、CNB 同步放出 Hy3 与 Hy3-FP8 两份权重。
Hy3 是一个 295B 参数的 MoE 模型,激活参数 21B,另有 3.8B 的 MTP(Multi-Token Prediction)层参数,上下文 256K,采用 Apache 2.0 协议,无地区限制。官方表示,Hy3 显著优于同体量模型,并与参数量为 2–5 倍的旗舰开源模型旗鼓相当。
本次发布距 4 月底的 Hy3 Preview 仅约两个月。官方提到,Preview 版上线后,他们收集了 50 多个产品团队的反馈,修复了任务执行与交互中的若干问题,并扩大了后训练(post-training)数据的规模与质量。
一、模型规格
| Property | Value |
|---|---|
| 架构 | Mixture-of-Experts (MoE) |
| 总参数量 | 295B |
| 激活参数量 | 21B |
| MTP 层参数量 | 3.8B |
| 层数(不含 MTP 层) | 80 |
| MTP 层数 | 1 |
| 注意力头 | 64(GQA,8 个 KV head,head dim 128) |
| Hidden Size | 4096 |
| Intermediate Size | 13312 |
| 上下文长度 | 256K |
| 词表大小 | 120832 |
| 专家配置 | 192 个专家,top-8 激活 |
| 支持精度 | BF16 |
二、Benchmark 表现
官方在两份图表中给出了 Hy3 与同体量及旗舰模型(包括 Hy3 Preview、GLM-5.2、Seed-2.1 Pro、DeepSeek V4 pro、Qwen-3.7 Max、GPT-5.5、Claude Opus 4.8 等)在推理、编码、Agent、长上下文等多个基准上的对比。


官方的总体结论是:Hy3 在推理、agentic 工作流和长上下文任务上都有"稳健的提升",性能已接近国内外主流旗舰模型;在编码、文档处理、金融分析、游戏开发、前端设计等生产力场景中,Hy3 定位为"可靠且具性价比"的选项。
真实业务盲测:270 位专家、312 组对比

除了公开 benchmark,官方还做了一轮面向真实工作流的盲测:
- 参与规模:来自不同学科的 270 位专家
- 有效对比:312 组
- 评分方式:4 分制
| 模型 | 得分 |
|---|---|
| Hy3 | 2.67 / 4 |
| GLM-5.1 | 2.51 / 4 |
官方表示,Hy3 的优势在前端开发、CI/CD、数据与存储三个方向最为明显。
三、产品体验:更可靠、更省成本
官方强调,公开 benchmark 无法完全反映生产环境下的真实体验。基于用户反馈与产品遥测数据,他们对几类"破坏体验"的行为做了针对性改进,并得到了产品团队的正面反馈。
输出格式与工具调用稳定性
修复了多项基线可靠性问题,使模型在不同工具配置和输出约束下达到"生产级"标准:
- 工具调用成功率与错误恢复能力提升
- 引发无限循环的无效调用减少
- 在不同 agent 脚手架间泛化良好
在 SWE-Bench Verified 上,跨 CodeBuddy、Cline、KiloCode 等脚手架的准确率波动控制在 4% 以内。
世界知识与反幻觉

官方将内部知识与外部幻觉视为相互关联的系统性问题,以"有依据时作答、缺证据时说明、不混淆来源、不编造数据"为目标,做了细粒度数据清洗与训练约束。
| 指标 | 改进前 | 改进后 |
|---|---|---|
| 幻觉率 | 12.5% | 5.4% |
| 常识错误率 | 25.4% | 12.7% |
这些改进显著减少了事实混淆、内容编造和逻辑矛盾。
复杂上下文保持与多轮意图追踪
通过 SFT 与 RL 的联合优化,Hy3 在指代消解、省略恢复、多轮约束继承等工程痛点上取得提升。在内部综合多轮测试中,问题率从 17.4% 降至 7.9%。在开源长对话基准 MRCR 上,从 42.9% 提升到 75.1%。
整体输出更简洁,同时确保复杂意图在长程交互中不衰减、不漂移。
四、开源与模型权重
| 模型 | 说明 | 获取渠道 |
|---|---|---|
| Hy3 | Instruct 模型 | HuggingFace / ModelScope / GitCode / CNB |
| Hy3-FP8 | FP8 量化版 Instruct 模型 | HuggingFace / ModelScope / GitCode / CNB |
许可证为 Apache License 2.0。
五、API 定价与限制
腾讯云 Hunyuan API 同步上线了 Hy3 正式版。Hy3 提供三档思考模式:no_think(极速响应)、think_low(快速思考)、think_high(深度推理),用户可在响应速度、推理深度与调用成本之间权衡。
定价
| 计费项 | 价格(元 / 百万 tokens) |
|---|---|
| 输入 | 1.0 |
| 缓存命中 | 0.25 |
| 输出 | 4.0 |
支持能力
- 深度思考(think_high)
- Function Calling
- 结构化输出
- Cache 缓存
输入输出均为文本格式。
调用限制
| 限制项 | 值 |
|---|---|
| 最大输入 Tokens | 192K |
| 最大输出 Tokens | 128K |
| 上下文窗口 | 256K |
| 最大 TPM | 1,000,000 |
| 最大 QPM | 60 |
参考链接
- HuggingFace 权重:https://huggingface.co/tencent/Hy3
- Hy3-FP8:https://huggingface.co/tencent/Hy3-FP8
- ModelScope:https://modelscope.cn/models/Tencent-Hunyuan/Hy3
- GitCode:https://ai.gitcode.com/tencent_hunyuan/Hy3
- CNB:https://cnb.cool/ai-models/tencent/Hy3
- GitHub:https://github.com/Tencent-Hunyuan/Hy3
- 官网:https://aistudio.tencent.com/
