用真实任务比较 Gemini 与 GPT-4,而不是寻找万能冠军。
Gemini 与 GPT-4 并不是完全对等的名称:Gemini 代表 Google 的产品和不断变化的模型家族;GPT-4 是 OpenAI 在 2023 年推出的模型,并通过产品和 API 提供。公平比较必须写明产品、模型、日期、方案、工具和测试任务。
先建立公平的比较方式
明确比较对象
普通用户应比较 Gemini Apps 与 ChatGPT;开发者则比较有文档支持的具体模型和 API 版本。
匹配真实任务
测试写作、文件分析、图片理解、编程、研究、语音、工具调用或现有工作流集成。
控制测试输入
使用相同指令、来源、格式、时间预算和评分规则,并记录模型与功能设置。
衡量总体适配
同时评估准确性、来源、体验、延迟、额度、隐私、价格、生态和失败恢复。
理解产品名称的差异
Gemini 可能指消费应用、手机助手、Workspace 功能、开发 API 或具体 Google 模型。GPT-4 是一个模型,ChatGPT 才是可能使用不同当前模型和工具的消费产品。
- 每次测试记录准确产品、方案、模型标签、日期和开启的工具。
- 不要把带搜索与应用集成的完整产品同裸 API 模型比较。
- “最新”、上下文、价格和开放范围都属于易变化信息。
比较日常 AI 助手体验
重视 Google 服务、Android 手机助手、Gemini Live 或 Google 工作流的用户可能更适合 Gemini;ChatGPT 则可能根据当前方案提供不同模型、工具和自定义助手。
- 在两个产品中测试相同的邮件、规划、学习、研究和创意任务。
- 确认哪个工具能连接你已使用的服务,以及需要哪些权限。
- 从官方产品页确认免费与付费额度,不复制旧对比表。
比较多模态和创作能力
两个生态都支持文字与图片组合,当前产品还可能提供文件、语音、图片生成等工具。应针对实际使用的界面和模型测试。
- 只有双方设置都支持时,才用相同文档、截图、图表、照片、音频或视频比较。
- 评分应覆盖抽取准确度、来源追溯、视觉一致性、指令遵循和修改质量。
- 不要把主观审美写成没有依据的统一排名。
比较编程与开发集成
开发者需要比较 SDK、结构化输出、工具调用、模型开放、速率限制、可观测性、数据条款、地区和总成本,而不只是代码看起来是否漂亮。
- 运行同一套私有测试,检查正确性、安全性、可维护性和回归率。
- 模型标识符放入配置,因为推荐型号和端点会变化。
- 架构决策前阅读 Google 与 OpenAI 最新官方 API 文档。
用可重复评测做选择
从真实工作建立小型测试集,查看结果前先定义通过标准,条件允许时盲评,并在重大模型或产品变化后重新测试。不同任务使用两个工具也完全合理。
- 纳入普通、困难、多语言、模糊和安全敏感案例。
- 记录事实错误、引用支持、完成率、编辑时间、延迟和成本。
- 选择能在你的任务与风险等级下减少总验证工作量的产品。