https://openreview.net/forum?id=QMy2RLnxGN
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video...
Recent LLM-driven visual agents mainly focus on solving image-based tasks, which limits their ability to understand dynamic scenes, making it far from...
large language models