端侧模型落地,先别急着全员换机
社区讨论 · 赛道

端侧模型落地,先别急着全员换机

一鸣一鸣9月9日2026/09/09 55 浏览

周末折腾了一下华为端侧本地大模型,踩了不少坑。

最近给客户做现场演示,痛点很直接。云端模型够用,但客户最怕资料出域。尤其医疗、制造这类场景,现场照片和会议记录丢到云端前,要先过法务。我用了大约一个月云端GPU跑原型,算力调度、数据管道这些隐形成本已经够烦,端侧如果能断网跑,值得看。

消息称华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署,有多模态增强大模型(6GB 左右)和多模态混合专家大模型(15GB 左右)共自主选择下载。

我周末借了两台机器,一台 Mate XT 2,一台 Pura X View。先解释下,端侧本地大模型,就是模型直接跑在手机本地,不依赖云端;多模态,是文本、图片等一起处理;MoE,混合专家,总参数可以很大,但每次只激活一部分,试图在体积和能力之间找平衡。

方案按创业团队常见拆法来试。先下 6GB 左右的多模态增强模型,测轻任务;再下 15GB 左右的混合专家模型,测长上下文。Mate XT 2 这边还看到 300 亿总参数、20 亿激活参数这类端侧 MoE 的描述,但我不太信发布会参数,先看自己样本。

实际跑下来,轻任务有惊喜。拍了张白板照片,让模型提取要点,6GB 模型能识别出大部分标题和待办。断网后再试,还能继续出结果。对现场工程师、销售、外勤来说,手机里有个能摘要、能看图的小模型,比每次打开云端工具更顺手。

坑也不少。第一个坑是模型选择并不直观。入口里能看到两个模型,一个偏轻,一个偏重,用途说明比较简,第一次下载容易只按大小选。我这边测下来,15GB 模型对长材料更稳,表格、条款不容易丢主语;代价是下载慢,占存储,连续跑几段机身会热。复杂任务也不能全交给端侧。我让它把一段客户访谈变成需求列表,6GB 模型漏掉了责任边界;换成 15GB 后好一些,但格式还是会飘。

从商业模式看,这件事会牵涉采购和适配成本。端侧把一部分推理成本从云端搬到用户设备,云端费用会降,但客户换机、软件适配、模型更新成本会升。我管三十人团队,最怕为了一个AI功能全员换旗舰。如果客户本来就要采购新手机,这个能力是加分项;如果为了端侧专门换机,现金流压力立刻显形。

适合谁,我觉得有两类。一类是现场交付,网络不稳定,资料敏感,端侧能先做摘要、脱敏、图片说明。另一类是演示场景,客户要看到“数据不出手机”,比讲架构更有说服力。不适合谁也很明确。需要长文档批量处理、复杂工具链、稳定格式输出的团队,别指望端侧替代云端服务。预算紧的小团队也别全员上,先借样机做两周真实任务测试。能不能落地,要看现场同事愿不愿意用它做记录,参数只是参考。

下一步我想拿两个模型跑一周真实样本,包括客户照片、会议纪要、工单记录,看断网可用率、发热、误答率和人工复核时间。比较理想的路径是混合架构,手机本地先做隐私过滤和短摘要,云端负责复杂分析和代码生成。这样端侧把最敏感、最轻量的那一层留在现场。

1 条回复

?
Ctrl + Enter 快速回复
Amy
Amy9月9日

救命,我连Excel宏都懒得学,还端侧模型?行政只关心它能不能自动对账。