1036 字
5 分钟

用了半年不同 AI 模型后,我的选择标准变了

年初的时候,我仍然会认真阅读每一次模型发布的榜单,试图找出一个“最强模型”。用了半年之后,我的选择标准发生了很大变化:我不再希望一个模型包办全部工作,而是更在意它是否适合当前任务。

这种变化并不是因为模型差距缩小到完全相同,而是因为模型能力已经足够复杂,单一排名越来越难描述真实体验。

写作:自然不等于正确#

写作时,我更重视语气、结构和修改能力。Claude 往往能给出比较连贯的长文,GPT 在按照明确要求调整结构时很稳定,Gemini 适合把多份资料合并整理,中文开源模型在中文表达和本地处理上也越来越实用。

但无论使用哪个模型,我都不会直接发布第一次生成的文章。AI 很容易写出“读起来正确”的句子,其中却没有具体信息。真正有个人风格的部分,通常来自自己的经历、判断和删改。

编程:验证能力比生成速度重要#

编程模型最让我改变看法的一点,是生成速度并不等于完成速度。

一个模型可以在几十秒内写出几百行代码,但如果它没有阅读项目规则、没有运行构建,也没有检查页面,后续修复可能需要更长时间。相比之下,一个先搜索再修改、最后主动验证的模型,即使过程慢一些,也更值得信任。

因此我现在会观察模型是否做到:

  • 修改前读取相关文件。
  • 沿用项目已有写法。
  • 遇到报错时先分析原因。
  • 完成后运行最小有效验证。
  • 明确说明没有验证的部分。

搜索:答案需要来源#

模型很擅长把信息组织成清晰答案,但越流畅的回答,越容易让人忘记检查来源。

涉及版本、价格、政策和发布日期时,我会优先选择能够联网并提供引用的产品。模型负责缩小搜索范围和比较观点,最终事实仍然回到原始文档确认。

如果一个答案无法说明信息来自哪里,我会把它当作线索,而不是结论。

私有数据:能力不是唯一指标#

处理个人笔记、账号信息和内部文件时,我会优先考虑数据去向。即使云端模型能力更强,也不代表所有资料都应该上传。

本地模型不一定能完成最复杂的推理,却很适合分类、摘要、格式转换和知识库检索。对这些任务来说,隐私和可控性比多几个榜单分数重要。

我现在的选择方法#

任务优先考虑
快速问答、改写速度快、成本低的通用模型
复杂规划、疑难代码推理和工具能力强的模型
长文档与多媒体上下文和多模态能力成熟的模型
私密资料与批量处理本地或自托管开源模型
高风险结论多模型交叉检查,加人工确认

我还会保留一组自己的测试任务。每次遇到新模型,先用真实问题测试,而不是跟着官方演示得出结论。适合别人的模型,不一定适合我的工作方式。

最后的看法#

模型更新速度还会继续加快,“版本答案”的有效期只会越来越短。与其记住每一代模型的排名,不如建立一套稳定的选择标准。

我现在最看重的是可靠性、工具能力、成本、隐私和可验证性。模型名称排在这些因素之后。

AI 最有价值的状态,不是让人每天纠结应该选择谁,而是在需要时自然地成为工作流程的一部分。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

用了半年不同 AI 模型后,我的选择标准变了
https://blog.voqz.de/posts/how-i-choose-ai-models-2026/
作者
UmU
发布于
2026-07-27
许可协议
CC BY-NC-SA 4.0

目录