资讯
我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜
📋总体概括
硅星人Pro受开发者Simon Willison自2024年沿用的「自行车鹈鹕」SVG绘图测试启发,自行搭建了一个「你画我猜Benchmark」,用1350张图片对多个AI模型进行横向评测,结果显示GPT-6以微弱优势险胜。这项测试原本是开发者圈内的玩笑式传统,如今已演变为观察新模型多模态理解与生成能力的保留节目,甚至有观点怀疑模型公司是否已开始针对类似测试题目做针对性优化。
⚡关键信息
- ▸评测源于Simon Willison自2024年起反复使用的「自行车鹈鹕」SVG测试题
- ▸本次Benchmark共生成并评测了1350张图片,规模远超个人娱乐性测试
- ▸评测结果GPT-6以险胜方式登顶,说明头部模型差距已很小
- ▸有人认真调查过模型公司是否针对这只鹈鹕类题目做了专门优化
🔥犀利点评
用画SVG当Benchmark,本质是用极低成本的视觉任务撬动模型的空间理解、指令遵循和代码生成能力,聪明但粗糙。1350张图后「险胜」这个结果恰恰说明:图像生成类评测的天花板太低、区分度太弱,头部模型已进入测不出差距的区间。与其追问公司有没有针对鹈鹕作弊,不如承认这类趣味Benchmark正在丧失评测效力,社区需要更硬的题。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 虎嗅 阅读全文 →