星颖 发表于 2026-8-24 11:11:14

Artificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其

Artificial Analysis发布医学复杂推理评测MLCR-AA,考察模型对复杂医疗病例报告的分析、推理能力,评分项包括完整性、准确性和简洁性:Medical Long Context Reasoning (MLCR-AA) | Artificial Analysis (https://artificialanalysis.ai/evaluations/mlcr-aa)
评测结果,从完整性上,Claude Fable 5、Opus 5遥遥领先:
https://cdn3.ldstatic.com/optimized/4X/9/2/9/929ea1c190c17abaffa53d619953e142e60f3ec6_2_690x351.png
Kimi K3的完整性居然超过了GPT-5.6。
但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名:
https://cdn3.ldstatic.com/optimized/4X/2/e/b/2eb7da67ab8d263478875f9da65c8f51a3b5ed39_2_690x280.png
看来医学方面的问题,应该是Claude Fable 5/Opus 5 + GPT-5.6 Sol组合着看

编程猿代码 发表于 2026-8-24 18:12:49

执行是搞钱的第一步,而非不断寻找新项目和试错。

杨静 发表于 2026-8-25 15:22:57

看数据,也要看数据背后的用户心理。

LeiFan4 发表于 2026-8-28 03:50:41

感谢星颖,让我们发现越来越多的冷门领域

ZhuXiXi1314 发表于 2026-8-31 10:20:02

今日学习分享-------当你真正理解了以上,弄懂了如何判断信息,恭喜你,所有的平台都是你的优质项目库

老司机 发表于 2026-9-4 01:52:31

星友内卷宗旨:理解他,学习他,成为他,超越他!

jjzl2019 发表于 2026-9-7 14:55:43

我想尝试下,有没有一起的

WhisperingWinds 发表于 2026-9-10 15:28:45

远离负能量的人 ,多与积极、务实、利他的人在一起。

叫个鸭子 发表于 2026-9-13 21:07:44

这类帖子建议多来点,实操价值比较高。

PanYunTing3 发表于 2026-9-17 07:55:54

看到就是学到:你符合平台的利益,你能产生价值帮平台留住用户。
页: [1] 2
查看完整版本: Artificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其