谷歌发布新型视觉语言模型PixelLLM

PixeILLM可以应用于各种位置感知视觉语言任务,包括指代定位、位置条件字慕和密集物体字幕,并在RefCOCO和VisualGenome上取得了最先进的性能。

上一篇:

下一篇:

发表回复

登录后才能评论