社区讨论 · 赛道
一人团队不是终点,评测才是
一人团队之后,评测更重要
这个实验设计里,超八成参赛者为一人团队,比143万元奖金和超3万份投稿更值得看。这说明 AI 工具至少把从想法到 demo 的协作成本压下来了。我最近带学生跑 AI agent,对比的 baseline 是普通 function calling 和纯提示词;跑下来,检索、代码生成、调试反馈被串成流程后最省事,模型本身聪明程度反而没那么关键。
但数据不能只看热闹。没有专业开发背景者超六成,万粉以下创作者占88%,前10名约半数赛前不足1万粉。门槛确实降了。数据集偏差也要考虑:平台用户偏年轻、偏内容创作;Toy 平台上被使用,也不等于生产环境里可靠。
我更关心后面怎么评。ReAct 这类论文提醒过,工具调用让模型从答题走向做事,但要看任务成功率、副作用和可追溯日志。B站把作品推到真实用户面前,比颁奖更像实验。接下来要看热度能不能换成可复用的评测集。
物界前沿