首页|必读|视频|专访|运营|制造|监管|芯片|物联网|量子|低空经济|智能汽车|特约记者
手机|互联网|IT|5G|光通信|人工智能|云计算|大数据|报告|智慧城市|移动互联网|会展
首页 >> 移动互联网 >> 正文

中文大模型幻觉测评:豆包大模型准确率全球第一,超越DeepSeek-R1、Gemini-2.5、GPT-4o

2025年5月23日 20:00  CCTIME飞象网  

近日,根据SuperCLUE 发布的最新一轮中文大模型忠实性幻觉测评结果,豆包大模型1.5 Pro(Doubao-1.5-pro-32k)以仅4%的幻觉率、96%的准确率排名总榜第一,超越 DeepSeek-R1、DeepSeek-V3、Gemini-2.5-pro、GPT-4o-latest 等中外主流模型。

在涵盖文本摘要、多文本问答、对话补全等关键任务的细分评测中,豆包大模型1.5 Pro也均位列全球第一,在阅读理解任务中,其准确率则为国内最高,展现出在复杂语言理解与生成场景中的出色能力。

SuperCLUE 由独立第三方推出,是当前中文大语言模型评测的重要基准体系。其中 SuperCLUE-Faith 聚焦中文内容生成过程中的忠实性与幻觉控制能力,从文本摘要、阅读理解、多文本问答以及对话补全等角度展开测评,对象包括国内外共计16款具有代表性的模型,评估结果具备较强公信力与行业参考价值。

目前,豆包大模型家族已覆盖全模态、全场景,包括大语言模型、深度思考模型、视觉理解模型、语音大模型,以及图像、视频等视觉大模型,企业可以通过字节跳动旗下云服务平台火山引擎使用豆包大模型API服务。其中, 豆包大模型1.5 Pro 基于 MoE 架构构建并采用训练-推理一体化设计思路,在保证高性能的同时显著降低推理成本。通过激活有限参数实现对大规模场景的精准理解与生成,其综合性能已超过多款超大稠密预训练模型。

截至2025年3月底,豆包大模型日均 tokens 调用量已超过12.7万亿,是2024年12月的3倍,是一年前刚刚发布时的106倍。IDC 报告显示,2024年中国公有云大模型调用量激增,火山引擎以46.4%的市场份额位居中国市场第一。

据悉,火山引擎将于6月11日在北京举办FORCE原动力大会,将带来豆包大模型的最新升级进展与能力进化。

编 辑:T01
飞象网版权及免责声明:
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
推荐新闻              
 
人物
中兴通讯首席发展官崔丽:数智赋能 共拓中拉合作新路径
精彩视频
中国信通院赵爽:加快工业互联网安全体系建设 护航新型工业化行稳致远
【现场直击】2025工业互联网大会:分享实践 碰撞未来!
中国信通院田洪川:人工智能与工业互联网融合已涌现出上百种应用模式
中国信通院李海花:工业互联网标识解析驱动产业数字化变革
精彩专题
2025工业互联网大会
2025世界电信和信息社会日大会
第八届数字中国建设峰会
通信产业2024年业绩盘点
关于我们 | 广告报价 | 联系我们 | 隐私声明 | 本站地图
CCTIME飞象网 CopyRight © 2007-2024 By CCTIME.COM
京ICP备08004280号-1  电信与信息服务业务经营许可证080234号 京公网安备110105000771号
公司名称: 北京飞象互动文化传媒有限公司
未经书面许可,禁止转载、摘编、复制、镜像