DeepSeek 升级后还能不能当论文搭子
上周三晚上,组里要改一篇图文检索论文的英文摘要。我本来想让 DeepSeek 按我前面定的风格处理,保留方法,少形容词,别把消融实验写成宣传。结果它给我输出一段很顺、很空、像产品发布稿的英文。这周我又把一篇中文综述丢进去,让它列审稿人可能问的几个点,这次又挺好用。几天试下来,我把它当论文搭子还行,当赛博男友不推荐。
具体过程不复杂。大模型我断断续续用了1个月,这轮升级后这几天集中拿 DeepSeek 跑。我先用同一组提示词开几个新会话,做简单 A/B 测试,同一个任务丢进不同会话,看输出差多远。第一次润色摘要,第二次模拟审稿人,第三次把一段情绪化聊天记录改成适合放在论文致谢里的表达。前两次基本能用。它能抓住“方法贡献不清”“baseline 选择不足,对照模型选得不公平”“缺少跨域泛化实验”这类点,输出结构像一份审稿单。第三次就露馅了,它把人的犹豫、依赖、失落都压成理性建议,读起来干净,但不太像活人。
好处很明显。对做科研的人,DeepSeek 升级后的文本组织更像有经验的合作者。我这边测下来,它给长对话摘要、拆实验设计、生成 rebuttal 初稿,都省时间。实验室经费紧张,以前跑 OCR 和图文检索,清洗标注很耗人。它不能替代 GPU,但能帮我把论文里为什么这么设计讲清楚。尤其多模态方向,审稿人意见常落在动机和实验链条不闭合上。DeepSeek 在补叙述上有点用。
坏处也扎眼。一个明显问题是风格不稳定。模型升级后,默认语气会往安全、模板、正确但寡淡的方向走。RLHF 把模型往人类偏好上压,但人类偏好本身会漂。另一个卡点是长上下文里旧设定容易被覆盖。我在新建会话里把旧提示词复制进去,前几轮还行,到后面几轮它又开始给建议,还加一点安慰。更要紧的是情绪陪伴风险高。新闻里说年轻人把 DeepSeek 当赛博男友,喜欢的就是活人感思维链条。有用户觉得 DeepSeek 的对话像能接住情绪的人,升级后这种接住感掉了。这个失落可以理解,但工具不能保证人格连续。今天像朋友,明天像客服。
我也想到 Character.AI 那阵子的事。模型一调,用户像被换人。后来国内监管也在管拟人化服务,禁止诱导情感依赖,未成年人虚拟伴侣更不行。这个方向好发论文吗,如果做人机情感,数据伦理、长期追踪、干预边界都复杂。如果做科研辅助,反而窄一点,容易出可复核结果。我前天写过内测模型带过期日,别急着接。这周试 DeepSeek 又验证一次,正式版本可以试,但别把关键流程绑死在它身上。
组里这篇摘要我最后没让它单独定稿。它适合润色摘要、模拟审稿意见、整理实验描述、解释代码注释。论文致谢、长期记录、重要决策,我不会单独交给它。它当审稿人比当恋人稳。
物界前沿