Gemini4 发布了,榜单直接屠榜,13 项评测拿第一
大型工程代码、法律金融长文档、挖漏洞修漏洞、长视频理解能力很强
输出直接干到 100 万 token!一次性直接写完一整本几十万字的文档
谷歌憋出一个超长续航的重型 AI 苦力,写百万字长文、啃大项目代码、啃厚合同是绝活
但是!大家先别高兴
目前只有谷歌挑好的安全合作方能使用,普通连 API 都摸不到。所以你看很多人吹那都是没根据的瞎吹
而且第三方Arena的测评显示,Gemini 4的网站开发能力只比Qwen强一点,弱于GPT-6
sol,难道又是高分低能?
可以带大家回顾下Google的黑历史
Gemini 1.0 Ultra 宣传造假。
谷歌发布会吹爆Gemini Ultra MMLU 拿到 90 分,超过人类专家,碾压 GPT-4。结果是同一个题,让模型算 32
遍,选出现最多的答案,这才拿到 90 分
还有Gemini 3.8 Flash 惊天跳水
使用旧评测 Terminal-Bench 2.1,Gemini3.8 Flash 89.4 分,全网第二!换新版
Terminal-Bench4.0,直接掉到 19.1 分,倒数!
所以还是让子弹飞一会儿!在普通用户能上手实战之前,Gemini 依旧摆脱不了北美 “豆包”
这个戏称。榜单吹得再天花乱坠,没有大众实测的检验,都只能当参考。




