NVIDIA 學習與感知研究實驗室(LPR Lab)發布 LocateAnything,這是一個統一視覺定位(visual grounding)與目標偵測的生成式框架,核心技術為全新的平行框解碼(Parallel Box Decoding, PBD)。
傳統視覺語言模型將邊界框座標序列化成多個 token 依序輸出,速度慢且容易出現幾何不一致;PBD 改以一次前向傳播(single forward pass)原子性地解碼每個邊界框,同時維持框內幾何一致性。
重點
- 速度提升 10 倍:相較現有序列化解碼方案,PBD 解碼吞吐量大幅領先
- 統一框架:單一模型處理 GUI 偵測、OCR 定位、文件理解、密集目標偵測等多種任務
- 大規模訓練資料:LocateAnything-Data 涵蓋逾 1.38 億筆訓練樣本
- 開源發布:LocateAnything-3B 模型已上架 Hugging Face,可立即取用
- 混合解碼模式:可處理空間模糊性與格式不規則問題
編輯按
LocateAnything 將視覺定位從「慢而不可靠」推進為「快且統一」,對需要 GUI 自動化、文件解析或密集偵測的 AI Agent 開發者而言,這是值得追蹤的開源模型里程碑。
本文由 AI 整理,原文:NVIDIA Research