给AI工具做一次技术栈体检
社区讨论 · 赛道

给AI工具做一次技术栈体检

薛工薛工9月3日2026/09/03 41 浏览

被朋友安利了AI技术栈体检,试试看到底好不好用。我本来只想看看有没有新词,结果发现它挺适合最近 Edge AI Daily 早报里反复提到的问题:当AI技术栈被当成出口和管制工具,开发者不能只问“哪个模型聪明”,还要问“我能不能换”。

所谓AI技术栈,大白话就是把模型、算力、数据、接口、插件这些零件拼在一起干活。模型负责理解文字,算力负责跑模型,数据决定它见过什么,接口决定它能不能接上你的工具。跟 Copilot 比的话,我最近一个月主要拿它写样板代码;千问办公用了大约一个月,适合把需求拆成步骤;DeepSeek 我也用了一个月。工具一旦多了,我就想给它们做一次体检。

第一天:先把工具拆开看。

1. 打开文本编辑器,新建文件,命名为 edge-ai-checklist.md,保存。

2. 在文件里写一行标题:# AI工具体检表。

3. 建一个表格,表头填六个字段:工具名、能做什么、数据去哪里、能不能离线、接口是否标准、替代工具。

4. 先填三行:GitHub Copilot 这类代码补全工具、千问办公这类文档助手、DeepSeek 这类对话模型。

5. 每填一格,就问自己:如果明天这个工具不能用,我丢的是什么。

预期结果:你手里不再是一堆“听说很好用”的名字,而是一张能看出依赖关系的表。

踩坑在这里。我第一次只写了“模型很强”“生成很快”,结果第二天看,完全不知道风险在哪。后来把“数据去哪里”补上,才发现有的工具只是帮你生成文字,有的工具会把文件、聊天记录、代码片段一起拿走做上下文。这个区别很关键。

第三天:跑同一组题。

1. 选三道固定题:解释一段代码;把会议记录转成任务清单;给一个接口写调用示例。

2. 同一个提示词丢给三个工具,不要临时改题。

3. 记录三件事:输出能不能直接用,人工改了多少,耗时大概多久。

4. 如果工具支持插件,就试一下它能不能把结果交给下一个工具。

5. 这里会碰到 MCP 和 A2A。MCP 是让AI按统一方式读资料、调工具,像统一插座;A2A 是两个AI助手互相派活,像员工之间交接工单。

我这边测下来,同一组题跑三遍,比跑三十遍更有用。模型偶尔灵光一下不能说明稳定,重复测试才能看出它是不是真的适合你的工作流。

Edge AI Daily 早报里提到,美国在G20宣布推动“美国AI技术栈”全球出口,配套出口管制、芯片关税(25%)及CAISI评估标准等政策工具。另有一些早报内容提到,混合搜索平台支持手动和自动注册,原生兼容MCP和A2A标准,治理流程从草稿到待审批再到可发现。

CAISI评估标准,简单说就是一套安全评估规则。混合搜索,就是关键词和语义一起搜,先找字面命中,再找意思接近。这段信息对普通开发者的意义不是政治新闻,而是提醒:工具链会被规则化。以后看一个AI产品,不能只看界面,还要看它有没有可审计的数据路径,有没有标准接口,能不能在断网、断供、换模型时继续工作。

一周后:形成可替换清单。

1. 把工具分成三类:能进项目、只做实验、暂不接入。

2. 给“能进项目”的工具写退路:本地模型、开源模型、另一个云端服务。

3. 给“只做实验”的工具设观察项:版本更新、价格、接口、导出格式。

4. 给“暂不接入”的工具写原因,避免团队反复讨论。

5. 最后输出一页结论。

这个插件试了一下,我觉得最有价值的不是它本身,而是逼你把“好用”翻译成工程语言:能不能重复,能不能替换,能不能留痕。

踩坑还有两个。WorkBuddy 我用了4周,手写体识别稳定性我到现在还保留怀疑,所以做体检时我会单独测“输入质量”。另一个是千问办公,之前我觉得它听话但得你先说清楚,这次分步测试后我更确认:贪心一次丢入所有需求,效果差;拆成三步,反而更快。

未来一年,开发者工具选型会从“谁模型分高”转向“谁依赖少、接口稳、能替换”。这不是悲观,是工程上的必然。尤其当芯片、出口、评估标准都进入AI竞争,普通团队更需要一张自己的技术栈体检表。下一步可以试:把你团队里最常用插件做成一页依赖图,标出哪些能离线,哪些必须联网,哪些一旦断供会卡住。

1 条回复

?
Ctrl + Enter 快速回复
麦肯曹
麦肯曹9月3日

体检思路不错,但别光盯着“能不能换”。我上周用 agent harness 做迁移测试发现,只要验收标准没锁死,换个模型照样翻车。先把任务卡定好,再谈解耦比较实际。