深度求索推出多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 並開放 API 服務

深度求索宣佈全新的多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上線於 DeepSeek API 平台。作為一款實驗性質的模型,此模型在保留文本理解、推理及 Agent 能力的同時,進一步增強了視覺理解能力,使用者可通過 API 直接調用。此次更新意味著 DeepSeek 將多模態能力進一步應用於 Agent 應用場景,為 PPT 製作、網頁開發及前端創意等任務提供新的模型能力支持。

根據官方公佈的信息,DeepSeek-V4-Flash-Vision-Exp 的核心特點在於兼顧文本及多模態能力。在 Agent、推理及世界知識等純文本任務中,該模型的表現與 DeepSeek-V4-Flash 正式版基本持平,並未因增加視覺能力而明顯犧牲文本處理能力。而在需要理解圖像內容的 Agent Benchmark 中,新模型相比 DeepSeek-V4-Flash 實現了明顯提升,多模態 Agent 能力已接近 Opus-4.8。

DeepSeek-V4-Flash-Vision-Exp 提升了多模態能力

在實際應用方面,深度求索展示了多個使用案例。其中一個場景是利用 Agent 框架製作商業定製的西藏自駕遊 PPT。使用者可以直接提出包括路線、行程週期、目標客户及視覺風格在內的複雜要求,模型隨後結合多模態能力完成內容及視覺呈現。另一個案例則是對 DeepSeek Harness 官網進行二次創作,通過黑藍深海、玻璃 UI 以及 ASCII 原子像素等視覺元素,在多輪交互後生成具有未來主義風格的開發者網站。

此外,該模型還可用於製作動態前端 Mini Demo,例如按照“3D 黏土小怪物加入復古舞池派對”的創意生成相應的動態視覺效果。

從這些案例可見,此次升級的重點並不僅限於讓模型具備“看圖”能力,而是希望將視覺理解進一步融入 Agent 工作流程。對於需要同時處理文字、圖片、網頁及代碼的任務而言,模型能理解視覺信息後,便可進一步參與內容生成、頁面設計及交互開發,從而涵蓋更多此前主要依賴文本模型完成效果有限的使用場景。

開發者可靈活調用 DeepSeek API

在 API 服務方面,開發者可通過設置 model=’deepseek-v4-flash-vision-exp’ 調用此實驗模型。圖片在 API 服務中會轉換為 Token 並按 Token 計費,單張圖片最多佔用 384 個 Token,整體計費價格與 DeepSeek-V4-Flash 保持一致。接口目前支持 Chat Completions、Messages 和 Responses 三種調用格式,並支持圖文混合輸入。

圖片既可以通過 Base64 內聯方式傳入,也可以使用外部 URL 或 Files API 進行調用,因此能夠適配不同的 Agent 開發框架和應用場景。

與此同時,深度求索還宣佈 Files API 正式開放,而該 API 本身不收取費用。開發者可以提前將圖片上傳至平台,之後在 API 請求中直接通過 file_id 引用對應文件,無需在每一次請求中重複上傳同一張圖片。對於需要反復調用相同素材的 Agent 應用而言,這種方式能夠減少重複傳輸帶來的帶寬開銷,也有助於簡化開發流程。

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版