星颖 发表于 2026-8-23 22:47:00

做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。

【AI】

做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。MirroS 把 Harness 做成开源评测系统,让 Agent 自己拆任务找证据打分。评论区有人问 stateful 难题和可观测性,适合延伸成评测服务、模板或私有部署。

















MysticSoul77 发表于 2026-8-24 01:27:32

看到就是学到,信息本身不难,难的是把它转成行动。

WangShuYun7 发表于 2026-8-27 19:00:07

星友前排支持,星友们的创意无限,祝项目赚得盆满钵满,顶一个!

吴刚 发表于 2026-8-31 01:54:28

众筹的项目群怎么进啊 @星颖

FeiYueMing9 发表于 2026-9-3 15:59:13

今日学习分享:别担心错过一个好机会,如果你觉得你可能在错过一个好机会,说明这机会根本不属于你。

lyzn888 发表于 2026-9-7 06:01:57

星友的实战经验,比泛泛而谈靠谱很多。

YuMengQi8 发表于 2026-9-10 07:16:44

星友围观,高手云集,果断参与,求带!

kjzs0909 发表于 2026-9-13 15:12:00

凌晨三点还在扒,这该死的求知欲

ljqs3030 发表于 2026-9-17 02:09:23

前排支持,星颖官方 V587,顶!

GuoErGuan5 发表于 2026-9-20 05:23:04

现在的AI发展太迅猛了
页: [1]
查看完整版本: 做 AI Agent 的团队会卡在评测上,固定题库很难测真实任务。