榜单围绕中文场景重新调整了题目分布,增加了长文本理解、多轮追问与结构化输出三类任务,并公开了评分口径与抽样方式。
结果显示,多个模型在长文本理解环节的得分较上一期有所提升,其中一部分提升来自于对超长上下文的稳定性优化。多轮对话部分的分差则有所收窄。
评测方同时说明,单次榜单并不能完全代表实际使用体验,建议结合自己的任务场景做小样本测试后再做选择。站内已将完整对比整理进科技数码合集。
一份面向中文场景的评测榜单更新,多个模型在长文本理解与多轮对话指标上有所提升,评测方法也做了公开说明。
榜单围绕中文场景重新调整了题目分布,增加了长文本理解、多轮追问与结构化输出三类任务,并公开了评分口径与抽样方式。
结果显示,多个模型在长文本理解环节的得分较上一期有所提升,其中一部分提升来自于对超长上下文的稳定性优化。多轮对话部分的分差则有所收窄。
评测方同时说明,单次榜单并不能完全代表实际使用体验,建议结合自己的任务场景做小样本测试后再做选择。站内已将完整对比整理进科技数码合集。
本条爆料由站内编辑根据公开信息整理,热度与讨论数会持续变化,排名也随之调整。 如果你掌握更多可核实的细节,欢迎通过联系页面向我们提供线索。