星颖资源网

 找回密码
 立即注册
查看: 60|回复: 3

Artificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其

[复制链接]

5万

主题

1万

回帖

18万

积分

管理员

Rank: 9Rank: 9Rank: 9

积分
186368
发表于 6 天前 | 显示全部楼层 |阅读模式
Artificial Analysis发布医学复杂推理评测MLCR-AA,考察模型对复杂医疗病例报告的分析、推理能力,评分项包括完整性、准确性和简洁性:Medical Long Context Reasoning (MLCR-AA) | Artificial Analysis (https://artificialanalysis.ai/evaluations/mlcr-aa)
评测结果,从完整性上,Claude Fable 5、Opus 5遥遥领先:

Kimi K3的完整性居然超过了GPT-5.6。
但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名:

看来医学方面的问题,应该是Claude Fable 5/Opus 5 + GPT-5.6 Sol组合着看
回复

使用道具 举报

0

主题

2759

回帖

5518

积分

大师

Rank: 8Rank: 8

积分
5518
发表于 6 天前 来自手机 | 显示全部楼层
执行是搞钱的第一步,而非不断寻找新项目和试错。
回复

使用道具 举报

0

主题

2528

回帖

5056

积分

VIP(年费)

积分
5056
发表于 5 天前 来自手机 | 显示全部楼层
看数据,也要看数据背后的用户心理。
回复

使用道具 举报

0

主题

2824

回帖

5648

积分

VIP(年费)

积分
5648
发表于 前天 03:50 来自手机 | 显示全部楼层
感谢星颖,让我们发现越来越多的冷门领域
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

微信

社群

VIP

AI

顶部

QQ|本站内容来源网友投稿或网络转载,如果有侵权的内容,请联系我们删除。|小黑屋|人人为我,我为人人!| 星颖资源网

GMT+8, 2026-8-30 15:19 , Processed in 0.135696 second(s), 33 queries .

快速回复 返回顶部 返回列表