简体中文 English 日本語 Русский язык 한어

195

主题

43

回帖

60

修为

创始合伙人

积分
123
QQ


作者:@天选嘉鲤敦赵图图

GPT贵7.7倍只多对1次?DeepSeek V4.1 Flash斩杀线测评

GPT贵7.7倍只多对1次?DeepSeek V4.1 Flash斩杀线测评


一句话导读:图图解读一组公开小样本测评:DeepSeek V4.1 Flash 与 GPT、Claude 在同类四任务上各跑两次;算上失败成本后,GPT 平均每次通过费用约是 DeepSeek 的 7.7 倍,但「多对一次」并不能直接推出可无脑替换。

核心内容:
1. 测评设定:同样四类任务,每类跑两次。口播数据大致为 DeepSeek 通过 7 次、GPT-6 Astra 8 次、Claude Fable 5.1 6 次;把失败次数对应的费用也摊进去后,GPT 平均每次通过成本约 DeepSeek 的 7.7 倍。样本很小(共 4 道不同题,每模型约 8 次),只能当现象观察,不能当权威排行。
2. 失败类型 A——读表却不按格式交卷:某任务要求读表后只输出 JSON。Claude 两次都把表读对了,却因前面多写解释被判失败。测试未开强制结构化输出,也没有补救程序。图图比喻:让它做西红柿鸡蛋面,它偏要加红烧肉;你纠正后,它会把「没有红烧肉」反复解释写在最前面——老毛病是「说对了但不按交付格式」。
3. 失败类型 B——工具调用小错后未自愈:另一任务要调工具读账本、翻页、去重。DeepSeek 一次成功一次失败;失败时把真正空值写成带引号的字符串(口播近似 srno/空串类错误),且未在规定的四轮响应内改回来。对照公开原始记录,与报告描述一致。
4. 能力拆解:读图/读表能不能读对,是一回事;按格式交付是另一回事;出错后能否自行恢复又是一回事。把这几项揉成一个「能力百分比」再说「便宜所以直接替换」,购买建议过于省事。
5. 使用建议:对结果容易检查的苦活累活(批量材料提取字段、核对缺漏与数字错误),可设计校验流程,让 Flash 这类低费用模型跑大部分;对边界多、出错难发现、要 AI 独立接手陌生项目的工作,仍应更谨慎,不必因为后一种很难就把前一种也一律交给最贵模型。若主要是读材料、做提取、改局部代码,简单粗暴可能才是 Flash 的归宿。
6. 命名提醒:后缀叫 Flash / Pro 不如看它真正能稳定完成什么事;作者感觉有「Flash / Pro 乱入」的错位。

适合人群:在选型 DeepSeek / GPT / Claude 做提取、工具调用与自动化交付时,需要成本与可靠性权衡参考的开发者与创作者。

补充说明:本文按完整口播转写整理;模型营销名(如 GPT/Claude 具体版本号)以视频口播为准,可能与官方正式商品名略有出入。图图另提到 RH 在线模型/工作流与注册赠额,以视频说明为准。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

简体中文
繁體中文
English(英语)
日本語(日语)
Deutsch(德语)
Русский язык(俄语)
بالعربية(阿拉伯语)
Türkçe(土耳其语)
Português(葡萄牙语)
ภาษาไทย(泰国语)
한어(朝鲜语/韩语)
Français(法语)
QQArchiver手机版小黑屋粤ICP备2026002389号-1粤ICP备2026002389号-1 简体中文 English 日本語 Русский язык 한어 |网站地图