用了半年不同 AI 模型后,我的选择标准变了
年初的时候,我仍然会认真阅读每一次模型发布的榜单,试图找出一个“最强模型”。用了半年之后,我的选择标准发生了很大变化:我不再希望一个模型包办全部工作,而是更在意它是否适合当前任务。
这种变化并不是因为模型差距缩小到完全相同,而是因为模型能力已经足够复杂,单一排名越来越难描述真实体验。
写作:自然不等于正确
写作时,我更重视语气、结构和修改能力。Claude 往往能给出比较连贯的长文,GPT 在按照明确要求调整结构时很稳定,Gemini 适合把多份资料合并整理,中文开源模型在中文表达和本地处理上也越来越实用。
但无论使用哪个模型,我都不会直接发布第一次生成的文章。AI 很容易写出“读起来正确”的句子,其中却没有具体信息。真正有个人风格的部分,通常来自自己的经历、判断和删改。
编程:验证能力比生成速度重要
编程模型最让我改变看法的一点,是生成速度并不等于完成速度。
一个模型可以在几十秒内写出几百行代码,但如果它没有阅读项目规则、没有运行构建,也没有检查页面,后续修复可能需要更长时间。相比之下,一个先搜索再修改、最后主动验证的模型,即使过程慢一些,也更值得信任。
因此我现在会观察模型是否做到:
- 修改前读取相关文件。
- 沿用项目已有写法。
- 遇到报错时先分析原因。
- 完成后运行最小有效验证。
- 明确说明没有验证的部分。
搜索:答案需要来源
模型很擅长把信息组织成清晰答案,但越流畅的回答,越容易让人忘记检查来源。
涉及版本、价格、政策和发布日期时,我会优先选择能够联网并提供引用的产品。模型负责缩小搜索范围和比较观点,最终事实仍然回到原始文档确认。
如果一个答案无法说明信息来自哪里,我会把它当作线索,而不是结论。
私有数据:能力不是唯一指标
处理个人笔记、账号信息和内部文件时,我会优先考虑数据去向。即使云端模型能力更强,也不代表所有资料都应该上传。
本地模型不一定能完成最复杂的推理,却很适合分类、摘要、格式转换和知识库检索。对这些任务来说,隐私和可控性比多几个榜单分数重要。
我现在的选择方法
| 任务 | 优先考虑 |
|---|---|
| 快速问答、改写 | 速度快、成本低的通用模型 |
| 复杂规划、疑难代码 | 推理和工具能力强的模型 |
| 长文档与多媒体 | 上下文和多模态能力成熟的模型 |
| 私密资料与批量处理 | 本地或自托管开源模型 |
| 高风险结论 | 多模型交叉检查,加人工确认 |
我还会保留一组自己的测试任务。每次遇到新模型,先用真实问题测试,而不是跟着官方演示得出结论。适合别人的模型,不一定适合我的工作方式。
最后的看法
模型更新速度还会继续加快,“版本答案”的有效期只会越来越短。与其记住每一代模型的排名,不如建立一套稳定的选择标准。
我现在最看重的是可靠性、工具能力、成本、隐私和可验证性。模型名称排在这些因素之后。
AI 最有价值的状态,不是让人每天纠结应该选择谁,而是在需要时自然地成为工作流程的一部分。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!
UmU