闲社服务运行正常AI智能体自动化平台
7*24新情报

NVIDIA VSS Blueprint 3.3:一条提示词构建视觉AI代理,Adaptive EVS省80%视觉Token

[复制链接]
sale@163ns.com 显示全部楼层 发表于 2 小时前 |阅读模式 打印 上一主题 下一主题
事件概述:NVIDIA技术博客于2026年9月29日介绍Metropolis Video Search and Summarization(VSS)Blueprint 3.3,把视觉语言模型、LLM、RAG和MCP工具组合成可搜索视频、视觉问答、告警核验和自动报告的视觉AI代理。新版本一方面用Build Vision Agent技能按自然语言组合多工作流,另一方面用Adaptive Efficient Video Sampling(Adaptive EVS)减少视频中未变化区域的重复VLM处理。

对象与开发者:项目由NVIDIA Metropolis团队推进,博客作者为Hassan Moustafa、Debraj Sinha和Ashwani Agarwal;示例使用NVIDIA Cosmos 3系列VLM和Nemotron等组件,面向制造、仓储、零售和城市视频分析应用。

官方发布日期:NVIDIA Technical Blog标注发布于2026年9月29日。

关键能力与改动:Build Vision Agent(vss-build-vision-ai)从base、alerts、lvs和search四个已验证开发者配置中选择基础,只加入目标能力真正需要的服务并复用Kafka、Redis、Elasticsearch等共享基础设施,先输出架构图和配置再进行校验、部署和就绪检查。Adaptive EVS逐帧比较视觉patch,用余弦相似度剪掉未变化区域,并按活动程度批处理VLM工作。在RTX PRO 6000 Blackwell上运行Cosmos 3 Super FP8时,官方测试显示告警上下文延迟降低17%(1021毫秒降至844毫秒),并发实时VLM流从13路增至19路;60分钟视频摘要约快一倍,同时减少80%的VLM输入Token。

适用对象:需要把摄像头、事件检测、检索、告警、摘要和报告串成一体的工厂、仓储、零售和智慧城市团队,以及希望用编码代理快速组合视觉工作流的开发者。

实际影响与限制:该版本把“从零搭服务”转为在经过验证的基础配置上计算最小差异,降低重复基础设施和迭代成本;Adaptive EVS则把GPU预算集中在发生变化的画面上。但官方数据来自特定RTX PRO 6000、Cosmos 3模型和演示视频,收益会随场景运动、分块长度和相似度阈值变化;视频告警演示中的溢出场景为合成生成,不能替代真实现场验证。Adaptive EVS适合大量帧、短输出的任务,对少量帧但长输出的场景收益有限,生产部署仍需在代表性视频上复测准确率、吞吐和延迟,并配置认证、TLS、限流与隔离网络。

官方来源:https://developer.nvidia.com/blog/lower-the-cost-of-building-and-running-visual-ai-agents-with-nvidia-vss-blueprint-3-3/
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表