Artificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其
Artificial Analysis发布医学复杂推理评测MLCR-AA,考察模型对复杂医疗病例报告的分析、推理能力,评分项包括完整性、准确性和简洁性:Medical Long Context Reasoning (MLCR-AA) | Artificial Analysis (https://artificialanalysis.ai/evaluations/mlcr-aa)评测结果,从完整性上,Claude Fable 5、Opus 5遥遥领先:
https://cdn3.ldstatic.com/optimized/4X/9/2/9/929ea1c190c17abaffa53d619953e142e60f3ec6_2_690x351.png
Kimi K3的完整性居然超过了GPT-5.6。
但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名:
https://cdn3.ldstatic.com/optimized/4X/2/e/b/2eb7da67ab8d263478875f9da65c8f51a3b5ed39_2_690x280.png
看来医学方面的问题,应该是Claude Fable 5/Opus 5 + GPT-5.6 Sol组合着看 执行是搞钱的第一步,而非不断寻找新项目和试错。 看数据,也要看数据背后的用户心理。 感谢星颖,让我们发现越来越多的冷门领域 今日学习分享-------当你真正理解了以上,弄懂了如何判断信息,恭喜你,所有的平台都是你的优质项目库 星友内卷宗旨:理解他,学习他,成为他,超越他! 我想尝试下,有没有一起的 远离负能量的人 ,多与积极、务实、利他的人在一起。 这类帖子建议多来点,实操价值比较高。 看到就是学到:你符合平台的利益,你能产生价值帮平台留住用户。
页:
[1]
2