看懂图片

以下是根据您的要求,由SEO优化专家以人工撰写风格深度整理后的文章。全文在保留核心事实与技术细节的基础上,进行了逻辑重构、语言润色、信息分层与用户视角强化,显著提升可读性、专业感与搜索引擎友好度(如自然嵌入长尾词、问题导向句式、结构化小标题、语义丰富段落),同时规避AI生成痕迹,符合百度/微信搜一搜/知乎等平台的优质偏好。

(由多段落组成)

DeepSeek Harness迎来关键升级:多模态能力正式落地,纯文本模型也能“看懂”图片?

8月20日深夜,备受开发者关注的开源智能体框架——DeepSeek Harness发布v0.1.0-rc.8版本。这是其8月13日开启公测以来的首次重大迭代,也是首个全面支持多模态交互的稳定候选版。更新一经发布,迅速登上GitHub Trending热榜,并在国内AI开发社区引发热议:“DSH终于能直接传图了!”“连本地截图都能当指令用,太实用了!”

本次更新并非简单功能堆砌,而是围绕“让Agent真正理解上下文”这一目标,系统性补全了视觉感知链路。官方日志显示,共完成14项实质性优化,覆盖多模态输入支持、子代理协同调度、终端交互体验、工具链鲁棒性及开发者调试友好度五大维度。尤其值得关注的是:它既为原生多模态模型提供了“直连图像”的通道,又为纯文本大模型设计了一套轻量、可插拔的“视觉增强工具层”——这意味着,即使你用的是Llama-3或Qwen2这类无视觉能力的开源模型,也能通过OCR+像素分析+元数据提取,让Agent“推理出图片在说什么”。

图文混合交互成标配,工作流从此“眼见为实”

新版最直观的体验升级,是彻底打通了图像与指令的边界。现在,用户可在任意命令中直接插入本地图片:无论是`/goal`设定任务目标,还是`/plan`生成执行步骤,均可搭配截图、流程图、界面照片甚至手写笔记一同提交。输入框新增的`@`快捷菜单,更支持一键引用历史会话、拖拽上传文件、跨会话调用上下文——过去需要反复描述的“这张图里第三行左侧的按钮”,现在只需一张图+一句话,Agent就能精准定位。

更进一步,Windows用户迎来久违的体验优化:PTY终端现已默认启用持久化PowerShell会话,避免频繁重建环境导致的命令中断;极简模式下自动适配,开箱即用。对于常需处理PDF截图、产品原型图、代码报错界面的工程师而言,这相当于为日常研发装上了“视觉外挂”。

不依赖视觉模型?这套“工具层视觉”方案更值得细品

真正引发技术圈深度讨论的,是DeepSeek Harness对“视觉能力”的独特解法。当调用一个未声明`vision`能力的模型(如DeepSeek-V2-Base)时,系统并不会报错退出,而是自动触发一套降级工具链:
✅ 先用高精度OCR提取所有可读文字及坐标位置;
✅ 再统计主色调占比、扫描关键区域像素梯度变化;
✅ 同步读取EXIF元数据(尺寸、DPI、色彩空间、压缩方式);
✅ 最终将结构化结果(如:“文字‘Submit’位于右下角,背景92%为#F5F5F5,顶部有1px蓝色分割线”)拼合成文本提示,交由大模型综合推理。

这种设计巧妙绕开了对单一大模型能力的强依赖——它把“看图”拆解为“感知工具+推理模型”的协作范式。测试表明,在处理PPT大纲页、API文档截图、UI组件标注图等结构化图像时,准确率远超预期;虽尚难应对复杂场景摄影或抽象艺术画,但已足够支撑80%以上的工程辅助类视觉需求。

子代理生态加速扩张,Claude Code、Codex正式入驻

rc.8同步深化了其“一切皆插件”的核心哲学。两大重量级编程子代理——Anthropic的Claude Code与微软开源的Codex——现已支持按需安装为Profile Bundle。其中Codex更开放多实例配置能力:同一任务中,可并行启动“前端校验版Codex”与“后端生成版Codex”,各司其职。配合新加入的`web_search`并发查询、子代理`reportDelivery`事件唤醒机制,以及SQLite后端性能优化,大型历史会话分叉、多步骤自动化脚本等复杂场景的稳定性显著提升。

值得一提的是,社区早已自发构建起丰富的视觉扩展生态:`dsh-vision-toolkit`提供标准化像素分析接口;`modlens`专注文档图像结构化解析;而通过`pi2dsh`桥接的`pi-vision`方案,则让Pi-Model等轻量视觉模型也能无缝接入Harness体系。rc.8的发布,标志着原生多模态与工具层视觉正式进入“双轨协同”阶段。

从公测到多模态,不到一周的爆发力背后是什么?

回顾时间线:8月13日公测首发,当晚就有开发者实测完成88页英文论文翻译+贪吃蛇游戏全流程开发;8月20日rc.8上线,多模态能力即刻可用。如此高频迭代节奏,印证了DeepSeek Harness“小步快跑、反馈驱动”的工程文化。其底层架构始终锚定一个理念:模型不是万能的中心,而应是可替换的插件之一;真正的智能,诞生于工具、子代理、记忆与调度的动态编排之中。

未来可期的方向也很清晰:更多开源多模态模型的原生适配、视觉子代理的标准化协议、低代码可视化Agent编排界面……当“调用一个模型”变成“组装一套能力”,AI智能体的落地门槛,或将被DeepSeek Harness真正拉下来。

© 版权声明

相关文章

暂无评论

您必须登录才能参与评论!
立即登录
暂无评论...