画像を読めるDeepSeek V4がオープンウェイト化 API先行後にローカル利用へ

画像を読めるDeepSeek V4がオープンウェイト化 API先行後にローカル利用へ

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

DeepSeekのV4系で初めて画像理解に対応した実験モデル「DeepSeek-V4-Flash-Vision-Exp」が公開され、ローカル環境で実行できるようになった。PC Watchによると、公開は2026年8月31日(日本時間)。MITライセンスで提供される。

API提供に続き、モデルの重みを公開

DeepSeek公式資料によると、同モデルは視覚モジュールを組み込み、画像とテキストが混在する入力に対応する。画像の説明、スクリーンショット内の文字の読み取り、グラフ分析などが可能だ。

DeepSeekは8月21日、同モデルのAPI提供を開始していた。今回公開された公式Hugging Faceページには、vLLMやSGLangでの実行例が掲載され、量子化版をllama.cpp、Ollama、LM Studioなどで利用する導線も用意されている。

画像を含む評価は改善、ローカル実行には大容量メモリー

DeepSeekが公表したベンチマークでは、ApexBenchが36.5となり、DeepSeek-V4-Flash-0731の26.2から10.3ポイント上昇した。ただし、同社は比較対象のテキストモデルがApexBench内のマルチモーダル要素を無視する条件だったと注記している。Cybergymは75.3で、比較対象の76.7を1.4ポイント下回った。

モデル規模は305Bパラメータ。Hugging Face上の公式リポジトリは約168GBで、UnslothのGGUF量子化版も公開されている。9月3日確認時点では1bit版が82.4GBから、4bitのUD-Q4_K_XLが155GB、8bitのUD-Q8_K_XLが162GB。公式のvLLM稼働例は単一の4×GB300ノードを使っており、実行時には重み以外の領域も必要になるため、一般的なPCでの実用的な最低要件は明確ではない。

参考・出典

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]