
ArcGIS Living Atlas of the World 上提供的基于视觉语言上下文的分类预训练模型是用于分类图像的深度学习模型。
此深度学习包 (DLPK) 可作为 ArcGIS Pro 和视觉语言模型之间的连接,支持 OpenAI 的 GPT-4 和 GPT-4o 以及 Llama 模型。 OpenAI 和 Llama 视觉模型以其在自然语言处理和理解,以及类人文本的解析和生成方面的先进能力而著称。 将此类模型集成到 DLPK 中可以增强其实用性,由此能够处理图像并对影像中的对象执行零样本分类。
借助此 DLPK,可以在 ArcGIS Pro 中使用 OpenAI 的大型视觉语言和 Llama Vision 模型对图像和栅格执行对象分类。 此 DLPK 在分类对象方面具备灵活的适配能力,因为其不受预定义类别的限制;用户可以在工具运行时指定自定义类别标注。 这种对空间数据的分析和解读可帮助诸如环境科学、城市规划和遥感等领域的专业人员从其视觉数据集中提取有意义的见解。
许可要求
要完成此工作流,需满足以下许可要求:
- ArcGIS Desktop - ArcGIS Image Analyst 的 ArcGIS Pro 扩展模块
- ArcGIS Enterprise - 已配置栅格分析的 ArcGIS Image Server
- ArcGIS Online - ArcGIS Pro 或 Professional Plus 用户类型
模型详细信息
此模型具有以下特征:
- 输入 - 8 位 RGB 影像。
- 输出 - 包含图像分类信息的要素类。
- 计算 - 此工作流可在 CPU 或 GPU 上运行。
- 适用地理位置 - 此模型预计适用于全球。
- 架构 - 该实现采用 OpenAI 的视觉语言模型或 Llama Vision 模型。
访问和下载模型
从 ArcGIS Living Atlas of the World 下载基于视觉语言上下文的分类预训练模型。 也可以从 ArcGIS Pro 直接访问模型,或在 ArcGIS Image for ArcGIS Online 中使用模型。
要下载模型,请完成以下步骤:
- 浏览至 ArcGIS Living Atlas of the World。
- 使用您的 ArcGIS Online 凭据进行登录。
- 搜索 Vision Language Context-Based Classification,然后从搜索结果中打开项目页面。
- 单击下载按钮以下载模型。
您可以直接在 ArcGIS Pro 中使用下载的 .dlpk 文件。
发布说明
以下为发布说明:
| 日期 | 描述 |
|---|---|
2025 年 3 月 2024 年 12 月 | “基于视觉语言上下文的分类”第二版发布 “基于视觉语言上下文的分类”第一版发布 |