简体 | 繁体
loading...
新闻频道
  • 首页
  • 新闻
  • 读图
  • 财经
  • 教育
  • 家居
  • 健康
  • 美食
  • 时尚
  • 旅游
  • 影视
  • 博客
  • 群吧
  • 论坛
  • 电台
  • 焦点新闻
  • 图片新闻
  • 视频新闻
  • 生活百态
  • 娱乐新闻
您的位置: 文学城 » 新闻 » 焦点新闻 » 1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

文章来源: 量子位 于 2026-08-21 23:48:43 - 新闻取自各大新闻媒体,新闻内容并不代表本网立场!
被阅读次数

家人们,鲸鱼开眼了!

等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。

我也是第一时间赶到现场,连夜开始实测。

相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。

基础识图能力实测下来,和一直在内测的网页版差不多,感觉就是同一个模型。

但在Agent任务上,「眼睛」确实可谓是超强的装备了。

先看,纯文本能力(Agent、推理、世界知识等),DeepSeek-V4-Flash-Vision-Exp与DeepSeek-V4-Flash正式版持平。

但值得注意的是,在需要多模态的Agent Benchmark上,这个新视觉模型相比V4-Flash,实现了大幅跃升!

甚至已接近Opus-4.8。

官方也展示了一些demo。

首先是PPT,也是最需要视觉能力的白领场景了,纯靠AI盲画真的很难绷啊。。。

他们还用这个新模型对DeepSeek官网做了二次创作,你别说,玻璃UI动效还真挺好看的,建议merge到主线上(bushi)。

最后是一个黏土风格的前端,相比前俩demo灵动很多,也是在展示模型的审美吧。

如今,这个新视觉模型已上线API,计费价格与flash一致。

在API服务中,图片会转换成token后按token计费,一张图片最多占384 tokens。

如果按「高峰时期+缓存未命中」来计价的话,换算人民币,看一张图大约0.12分钱。

也就是说,即便每张都占满384 tokens,1分钱理论上能看大约9张图。

同样情况下,Image 2看一张需要2.06分,比DeepSeek贵将近20倍。。。

这还没完。

DeepSeekHarness也迎来了版本更新,正式原生支持「第一方」多模态模型。

现在,你可以直接在最新版的DSH里,选择这个视觉模型。

啧啧啧,模型和工具同天就位,接生一条龙是吧。

(bushi)

应该也是计划已久的合体吧,毕竟多模态模型搭配Harness食用,可以解锁很多新场景。

DeepSeek视觉模型实测

所以我也用DSH搭配Vision模型,测了一下。

满足一大心愿,之前DSH刚发的时候我就想做白模和Codex比比,奈何大鲸鱼没眼睛,我也不好意思欺负瞎子。

现在,我终于能让他照着图雕「牛来」了。

它自己下了个Blender,跑了很久,过程中截图返工了很多次。

最后的成果长这样——

效果真可以啊,虽然等了很久,但这个光泽确实不赖。

然后是前端任务,让他用Canvas手绘了个宇宙风格的demo,点击可生成UFO,效果还是不错。

其他Agent能力就不说了,官方demo都有,主要看看基础的识图能力。

找了张三代蜘蛛侠同框的图片丢给他,专门挑了侧脸的,想着可能难度高一点。

结果瞬间就出答案了,可能就两三秒,应该是已经被训练过。

需要WebSearch的也没问题,就是有点慢。

《牛来》剧照,这个视觉模型Loop了好几轮,在网上翻了个遍,花了三分多钟才出答案。

但用网页版就快特别多,看来简单识图确实不需要太多Tool Call。

最后,数手指还是不太行,这也是现阶段多模态模型的通病了,第一轮对话永远固执地认为是五根。

怎么说呢,如果单看识图能力的话,个人感觉就是网页版那个模型,能力没啥区别。

不过,现在搭配Harness和Max推理食用,确实可以赋能不少任务。

等了四个月的眼睛…

其实吧,从今年大Agent时代开启以来,大家都在嘟囔DeepSeek到底啥时候支持多模态。

可惜,众所周知,DeepSeek是一心向往AGI的,并不打算多模态上花太多心思,因此一拖再拖。。。

但像前端开发这类任务,看不了图真的很影响反馈迭代效率啊!!

图片生成无所谓,至少不能是瞎子吧。

Codex在这方面就特别方便,还和产品结合起来了,可以直接在图片上批注修改意见。

四月份,好消息来了——

DeepSeek开始灰测识图。

6月,这个识图模式,端上了网页版和App端。

不过,这个图片模型自此就没声了,一直在内测状态。。。

整整将近四个月过去,DeepSeek,终于摘下了眼罩。

One More Thing

对了,除了DS之外,多模态这块,国产模型圈还有个事儿。

最近X上出了个「牛来」模型。。。

是的,就是那个电影院的《牛来》,火爆了,让海外AI圈知道了什么是真正的抽象。

实在太火,甚至OpenCode都为这款新模型启动了「一周限免」活动。

目前,牛来模型还没正式认领,但最多的猜测,指向了智谱。

对,DeepSeek曾经的盲人兄弟,智谱。。。

`
  • 月满中秋,把健康送给自己,也送给最牵挂的人。美国专利产品【骨精华】守护骨骼与关节健康;【心血通】支持心血管健康;【益脑灵】呵护脑部健康与记忆力。
`
查看评论(1)
  • 文学城简介
  • 广告服务
  • 联系我们
  • 招聘信息
  • 注册笔名
  • 申请版主
  • 收藏文学城

WENXUECITY.COM does not represent or guarantee the truthfulness, accuracy, or reliability of any of communications posted by other users.

Copyright ©1998-2026 wenxuecity.com All rights reserved. Privacy Statement & Terms of Use & User Privacy Protection Policy

24小时热点排行

“好莱坞逆子”弑父母免于死刑 父母最后一次庇佑儿子
两个阿拉伯兄弟,何以反目成仇?
“天才少女”张家齐,决定向钱看
被捕时高喊“拜登万岁”的非法移民 已被驱逐出境
国民党立委称:有美方情报证实“中国AI是假的”






24小时讨论排行

万斯喊话 希望美国人民“再给一次机会”
欧盟再挖墙角:澳新等国可效仿加拿大 成联席成员
中国车解禁了? 比亚迪创办人传将随习近平赴美
黄仁勋见英王 查尔斯示警AI恐夺命 他这样回应
白宫特习会:北京放长线钓大鱼?
名古屋亚运会离谱失误:日本男女选手混住一个房间
开战以来规模最大 数十万伊朗人举行反美游行
习近平印度晕倒?传多名领袖峰会生病 官方证实是他
让马斯克破防的纪录片,究竟讲了什么?
黛妃弟弟出书爆料查尔斯惊人旧话 王室罕见反击
从计生到劝生,一场人口、生育“保卫战”
戴妃弟弟30年后“翻旧账” 把矛头对准了查尔斯三世
美国返还中方文物和化石都有些啥?高清大图来了
国产太空船票已经开卖,300万元一张
被指“国企党员搞满独” 宋剑仁因煽动民族仇恨罪获刑
双手淤青 脖子出现湿疹 特朗普的健康状况堪忧
文学城新闻
切换到网页版

1分钱9张图!DeepSeek视觉模型连夜实测

量子位 2026-08-21 23:48:43

家人们,鲸鱼开眼了!

等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。

我也是第一时间赶到现场,连夜开始实测。

相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。

基础识图能力实测下来,和一直在内测的网页版差不多,感觉就是同一个模型。

但在Agent任务上,「眼睛」确实可谓是超强的装备了。

先看,纯文本能力(Agent、推理、世界知识等),DeepSeek-V4-Flash-Vision-Exp与DeepSeek-V4-Flash正式版持平。

但值得注意的是,在需要多模态的Agent Benchmark上,这个新视觉模型相比V4-Flash,实现了大幅跃升!

甚至已接近Opus-4.8。

官方也展示了一些demo。

首先是PPT,也是最需要视觉能力的白领场景了,纯靠AI盲画真的很难绷啊。。。

他们还用这个新模型对DeepSeek官网做了二次创作,你别说,玻璃UI动效还真挺好看的,建议merge到主线上(bushi)。

最后是一个黏土风格的前端,相比前俩demo灵动很多,也是在展示模型的审美吧。

如今,这个新视觉模型已上线API,计费价格与flash一致。

在API服务中,图片会转换成token后按token计费,一张图片最多占384 tokens。

如果按「高峰时期+缓存未命中」来计价的话,换算人民币,看一张图大约0.12分钱。

也就是说,即便每张都占满384 tokens,1分钱理论上能看大约9张图。

同样情况下,Image 2看一张需要2.06分,比DeepSeek贵将近20倍。。。

这还没完。

DeepSeekHarness也迎来了版本更新,正式原生支持「第一方」多模态模型。

现在,你可以直接在最新版的DSH里,选择这个视觉模型。

啧啧啧,模型和工具同天就位,接生一条龙是吧。

(bushi)

应该也是计划已久的合体吧,毕竟多模态模型搭配Harness食用,可以解锁很多新场景。

DeepSeek视觉模型实测

所以我也用DSH搭配Vision模型,测了一下。

满足一大心愿,之前DSH刚发的时候我就想做白模和Codex比比,奈何大鲸鱼没眼睛,我也不好意思欺负瞎子。

现在,我终于能让他照着图雕「牛来」了。

它自己下了个Blender,跑了很久,过程中截图返工了很多次。

最后的成果长这样——

效果真可以啊,虽然等了很久,但这个光泽确实不赖。

然后是前端任务,让他用Canvas手绘了个宇宙风格的demo,点击可生成UFO,效果还是不错。

其他Agent能力就不说了,官方demo都有,主要看看基础的识图能力。

找了张三代蜘蛛侠同框的图片丢给他,专门挑了侧脸的,想着可能难度高一点。

结果瞬间就出答案了,可能就两三秒,应该是已经被训练过。

需要WebSearch的也没问题,就是有点慢。

《牛来》剧照,这个视觉模型Loop了好几轮,在网上翻了个遍,花了三分多钟才出答案。

但用网页版就快特别多,看来简单识图确实不需要太多Tool Call。

最后,数手指还是不太行,这也是现阶段多模态模型的通病了,第一轮对话永远固执地认为是五根。

怎么说呢,如果单看识图能力的话,个人感觉就是网页版那个模型,能力没啥区别。

不过,现在搭配Harness和Max推理食用,确实可以赋能不少任务。

等了四个月的眼睛…

其实吧,从今年大Agent时代开启以来,大家都在嘟囔DeepSeek到底啥时候支持多模态。

可惜,众所周知,DeepSeek是一心向往AGI的,并不打算多模态上花太多心思,因此一拖再拖。。。

但像前端开发这类任务,看不了图真的很影响反馈迭代效率啊!!

图片生成无所谓,至少不能是瞎子吧。

Codex在这方面就特别方便,还和产品结合起来了,可以直接在图片上批注修改意见。

四月份,好消息来了——

DeepSeek开始灰测识图。

6月,这个识图模式,端上了网页版和App端。

不过,这个图片模型自此就没声了,一直在内测状态。。。

整整将近四个月过去,DeepSeek,终于摘下了眼罩。

One More Thing

对了,除了DS之外,多模态这块,国产模型圈还有个事儿。

最近X上出了个「牛来」模型。。。

是的,就是那个电影院的《牛来》,火爆了,让海外AI圈知道了什么是真正的抽象。

实在太火,甚至OpenCode都为这款新模型启动了「一周限免」活动。

目前,牛来模型还没正式认领,但最多的猜测,指向了智谱。

对,DeepSeek曾经的盲人兄弟,智谱。。。

× 文学城 App
文学城 App
让阅读更方便
免费 · iOS/Android
立即下载