社区讨论 · 赛道

一人团队不是终点,评测才是

老邓老邓9月6日2026/09/06 42 浏览

一人团队之后,评测更重要

这个实验设计里,超八成参赛者为一人团队,比143万元奖金和超3万份投稿更值得看。这说明 AI 工具至少把从想法到 demo 的协作成本压下来了。我最近带学生跑 AI agent,对比的 baseline 是普通 function calling 和纯提示词;跑下来,检索、代码生成、调试反馈被串成流程后最省事,模型本身聪明程度反而没那么关键。

但数据不能只看热闹。没有专业开发背景者超六成,万粉以下创作者占88%,前10名约半数赛前不足1万粉。门槛确实降了。数据集偏差也要考虑:平台用户偏年轻、偏内容创作;Toy 平台上被使用,也不等于生产环境里可靠。

我更关心后面怎么评。ReAct 这类论文提醒过,工具调用让模型从答题走向做事,但要看任务成功率、副作用和可追溯日志。B站把作品推到真实用户面前,比颁奖更像实验。接下来要看热度能不能换成可复用的评测集。

1 条回复

?
Ctrl + Enter 快速回复
远哥
远哥9月6日

评测集这事我深有感触,刚用WorkBuddy那会儿,感觉模型挺聪明,一上真实业务就翻车。Toy平台的数据太干净了,根本测不出长尾问题。