TLDRocket
Sign in

Visual Document Retrieval Goes Multilingual

Hugging Face Blog

A new multilingual embedding model called vdr-2b-multi-v1 enables searching visual documents across five languages (English, Spanish, Italian, German, and French) without requiring optical character recognition or text extraction. The model was trained on 500,000 high-quality synthetic query-image pairs, the largest open-source multilingual dataset of its kind for visual document retrieval. The model achieves 3x faster inference than its predecessor while using 30% fewer image tokens, and enables cross-lingual retrieval such as searching German documents with Italian queries.

Related stories

The daily briefing

Every AI story that matters, in your inbox by 8am.

TLDRocket reads 60+ sources, removes duplicate coverage, and summarises the day in two minutes. Free, no spam, unsubscribe anytime.