连看好莱坞大片都学会了!贾佳亚团队用2token让大模型卷出新境界

由香港中文大学贾佳亚团队创造的多模态大模型LLaMA-VID,可以处理长达3小时的电影的输入,这填补了大语言模型在长视频领域的空白。这个系统的显著特性是其能以两个token的形式对每一个视频帧进行编码,这种方法简单而有效。此模型在理解游戏预告片、分析短视频和图片,以及阐述电影剧情方面表现出极高的准确性。其性能之强大,深受研究者们的赞誉。

上一篇:

下一篇:

发表回复

登录后才能评论