Robuta

https://openreview.net/forum?id=QMy2RLnxGN DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video... Recent LLM-driven visual agents mainly focus on solving image-based tasks, which limits their ability to understand dynamic scenes, making it far from... large language models