Vision-språkmodell

En AI-modell som kan tolka både bilder och text och förstå hur de hänger ihop.

Exempel från veckans nyheter

LFM2.5-VL-3B kan förstå skärmbilder och flera bilder, vilket gör den användbar för visuella AI-agenter på lokala enheter.

📰 Från vecka 33: Liten synmodell vässas för skärmar och edge-enheter