NVIDIA 學習與感知研究實驗室(LPR Lab)發布 LocateAnything,這是一個統一視覺定位(visual grounding)與目標偵測的生成式框架,核心技術為全新的平行框解碼(Parallel Box Decoding, PBD)

傳統視覺語言模型將邊界框座標序列化成多個 token 依序輸出,速度慢且容易出現幾何不一致;PBD 改以一次前向傳播(single forward pass)原子性地解碼每個邊界框,同時維持框內幾何一致性。

重點

  • 速度提升 10 倍:相較現有序列化解碼方案,PBD 解碼吞吐量大幅領先
  • 統一框架:單一模型處理 GUI 偵測、OCR 定位、文件理解、密集目標偵測等多種任務
  • 大規模訓練資料:LocateAnything-Data 涵蓋逾 1.38 億筆訓練樣本
  • 開源發布:LocateAnything-3B 模型已上架 Hugging Face,可立即取用
  • 混合解碼模式:可處理空間模糊性與格式不規則問題

編輯按

LocateAnything 將視覺定位從「慢而不可靠」推進為「快且統一」,對需要 GUI 自動化、文件解析或密集偵測的 AI Agent 開發者而言,這是值得追蹤的開源模型里程碑。

本文由 AI 整理,原文:NVIDIA Research