腾讯于 9 月 2 日发布混源系列最新的开放权重模型 Hy4 预览版。该模型在 Code Arena 排行榜上位列全球第 8,仅次于 Anthropic Claude Fable 5。 在 DeepSWE 基准测试中,Hy4 预览版得分 64.3,超过 DeepSeek-V4 Pro 和阿里巴巴 Qwen-3.8 Max。

Code Arena WebDev 排名:Hy4 预览版位列全球第 8

Hy4 预览版于 2026 年 9 月 2 日(周三)在 Code Arena 的 WebDev 排行榜上位列全球第 8,仅次于 Anthropic Claude Fable 5,领先于阿里巴巴 Qwen 3.8-Flash-Next(第 9 名)。上一代 Hy3 在同一排行榜上排名第 34,Hy4 预览版较上一代实现了显著的排名提升。Code Arena 的 WebDev 基准测试用于评估模型的 Web 开发能力。

DeepSWE 基准测试:Hy4 预览版得分 64.3

在衡量软件工程能力的 DeepSWE 基准测试中,Hy4 预览版得分 64.3,高于 DeepSeek-V4 Pro 的 62.7 和阿里巴巴 Qwen-3.8 Max 的 56.6,成为该基准测试中表现领先的开放权重模型之一。

Hy4 技术规格

Hy4 预览版的技术规格较上一代 Hy3 大幅提升:参数量从 2,950 亿增加至 7,700 亿,上下文窗口从 25.6 万 Token 扩展至 100 万 Token。腾讯旗下拥有全球收入最高的电子游戏业务、中国领先的社交网络微信以及其他多元化业务;分析师指出,腾讯能够利用广泛的内部业务数据提升模型训练质量。

高盛与汇丰分析师评估

高盛与汇丰分析师对 Hy4 预览版的评估要点如下:

高盛(训练方法):腾讯在生态系统中先部署预览模型、收集用户数据,再全面发布模型的训练模式,与生产力和编码工作量尤其相关。

汇丰(训练数据优势):腾讯使用了由软件工程、游戏、金融、安全等领域的内部专家共同创建的高质量训练数据。

汇丰(有待改进之处):Hy4 在推理复杂任务时耗时长于预期,并且倾向于过度验证自身工作。

常见问题 腾讯 Hy4 预览版在哪些基准测试中超越了 DeepSeek 和阿里巴巴的模型?

在 DeepSWE 基准测试中,Hy4 预览版得分 64.3,超过 DeepSeek-V4 Pro(62.7)和阿里巴巴 Qwen-3.8 Max(56.6);在 Code Arena 的 WebDev 排行榜上位列全球第 8,高于阿里巴巴 Qwen 3.8-Flash-Next 的第 9 名。

Hy4 预览版与上一代 Hy3 相比有哪些规格升级?

Hy4 预览版的参数量从 2,950 亿增至 7,700 亿,上下文窗口从 25.6 万 Token 扩展至 100 万 Token;在 Code Arena WebDev 排行榜上,Hy3 排名第 34,而 Hy4 预览版跃升至第 8。

汇丰分析师指出 Hy4 预览版有哪些不足?

汇丰分析师指出,Hy4 预览版在推理复杂任务时耗时长于预期,并且倾向于过度验证自身工作;但同时也认可其高质量训练数据来自软件工程、游戏、金融、安全等领域的内部专家。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到909075378@qq.com,本站相关工作人员将会进行核查处理回复

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部