由香港中文大学贾佳亚团队创造的多模态大模型LLaMA-VID,可以处理长达3小时的电影的输入,这填补了大语言模型在长视频领域的空白。这个系统的显著特性是其能以两个token的形式对每一个视频帧进行编码,这种方法简单而有效。此模型在理解游戏预告片、分析短视频和图片,以及阐述电影剧情方面表现出极高的准确性。其性能之强大,深受研究者们的赞誉。
由香港中文大学贾佳亚团队创造的多模态大模型LLaMA-VID,可以处理长达3小时的电影的输入,这填补了大语言模型在长视频领域的空白。这个系统的显著特性是其能以两个token的形式对每一个视频帧进行编码,这种方法简单而有效。此模型在理解游戏预告片、分析短视频和图片,以及阐述电影剧情方面表现出极高的准确性。其性能之强大,深受研究者们的赞誉。