本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]
DeepSeekのV4系で初めて画像理解に対応した実験モデル「DeepSeek-V4-Flash-Vision-Exp」が公開され、ローカル環境で実行できるようになった。PC Watchによると、公開は2026年8月31日(日本時間)。MITライセンスで提供される。
API提供に続き、モデルの重みを公開
DeepSeek公式資料によると、同モデルは視覚モジュールを組み込み、画像とテキストが混在する入力に対応する。画像の説明、スクリーンショット内の文字の読み取り、グラフ分析などが可能だ。
DeepSeekは8月21日、同モデルのAPI提供を開始していた。今回公開された公式Hugging Faceページには、vLLMやSGLangでの実行例が掲載され、量子化版をllama.cpp、Ollama、LM Studioなどで利用する導線も用意されている。
画像を含む評価は改善、ローカル実行には大容量メモリー
DeepSeekが公表したベンチマークでは、ApexBenchが36.5となり、DeepSeek-V4-Flash-0731の26.2から10.3ポイント上昇した。ただし、同社は比較対象のテキストモデルがApexBench内のマルチモーダル要素を無視する条件だったと注記している。Cybergymは75.3で、比較対象の76.7を1.4ポイント下回った。
モデル規模は305Bパラメータ。Hugging Face上の公式リポジトリは約168GBで、UnslothのGGUF量子化版も公開されている。9月3日確認時点では1bit版が82.4GBから、4bitのUD-Q4_K_XLが155GB、8bitのUD-Q8_K_XLが162GB。公式のvLLM稼働例は単一の4×GB300ノードを使っており、実行時には重み以外の領域も必要になるため、一般的なPCでの実用的な最低要件は明確ではない。
