CogVLM
C
Cogvlm
简介 :
CogVLM是一个强大的开源视觉语言模型。CogVLM-17B拥有100亿个视觉参数和70亿个语言参数。CogVLM-17B在10个经典的跨模态基准测试中取得了最先进的性能,包括NoCaps、Flicker30k字幕、RefCOCO、RefCOCO+、RefCOCOg、Visual7W、GQA、ScienceQA、VizWiz VQA和TDIUC,并在VQAv2、OKVQA、TextVQA、COCO字幕等方面排名第二,超过或与PaLI-X 55B相匹配。CogVLM还可以与您就图像进行对话。
需求人群 :
用于图像描述、问题回答和视觉定位
总访问量: 474.6M
占比最多地区: US(19.34%)
本站浏览量 : 100.2K
使用场景
使用CogVLM准确描述图像细节
使用CogVLM回答各种类型的问题
使用CogVLM进行视觉定位
产品特色
准确描述图像细节
回答各种类型的问题
视觉定位
AIbase
智启未来,您的人工智能解决方案智库
© 2025AIbase