NeoMME není další chatbot. Je to model pro porozumění obsahu
Na první pohled může NeoMME působit jako další multimodální AI model, který umí pracovat s textem a obrázky. Jenže jeho účel je jiný. Nejde o systém, který vám napíše e-mail, vytvoří obrázek nebo odpoví na otázku ve stylu běžného chatbota. NeoMME je především encodér – model, který převádí obsah do reprezentace vhodné pro další zpracování.
Prakticky to znamená, že se hodí například pro vyhledávání relevantních stran v PDF dokumentech, třídění materiálů, porovnávání obrázkových dokumentů nebo jako součást vizuálního RAG systému. Místo aby z dokumentu nejprve vytáhl text pomocí OCR a teprve potom ho indexoval, může pracovat přímo s obrazem stránky.
To je důležité hlavně u dokumentů, kde význam neleží jen v samotných slovech. Tabulka, graf, rozložení stránky, velikost písma nebo pozice poznámky mohou být stejně důležité jako text. OCR z takového dokumentu udělá textovou nudli. NeoMME se snaží zachovat i vizuální kontext.
H Company model představila na přelomu srpna a září 2026. Technický popis je dostupný v odborné práci na arXivu a modely jsou publikované na Hugging Face.
Jeden Transformer místo samostatných věží
Současné multimodální architektury často skládají několik různých částí. Jedna síť zpracuje obraz, druhá text a další část se pokusí jejich reprezentace propojit. U generativních modelů bývá obrazový encodér napojený na kauzální jazykový model, který následně vytváří odpověď token po tokenu.
NeoMME tento přístup vynechává. Textové tokeny i surové obrazové patche vstupují do stejného Transformeru a sdílejí všechny jeho vrstvy. Obraz se přitom rozděluje na nepřekrývající se RGB patche o velikosti 32 × 32 pixelů.
Přirovnání z běžného života: tradiční multimodální systém může fungovat jako firma, kde obraz analyzuje grafik, text zpracuje účetní a výsledky se spojí až na poradě. NeoMME se snaží dát oběma úkolům jeden společný tým a stejný pracovní postup. Není to automaticky lepší pro každý úkol, ale pro encodování může být taková konstrukce úspornější.
Modely podporují kontextové okno o velikosti 16 384 tokenů. Podle autorů to stačí až na zpracování dvou celých dokumentů v rozlišení 4K UHD. NeoMME tak není omezený pouze na malý výřez stránky nebo krátký textový dotaz.
Proč H Company vynechala kauzální dekodér
Kauzální dekodér je část modelu, která generuje text postupně. Je nezbytný pro chatbota nebo nástroj, který má napsat odpověď, ale pro vyhledávání bývá zbytečný. Vyhledávač nepotřebuje znovu vyprávět celý dokument. Potřebuje zjistit, zda se dokument hodí k dotazu, a převést ho do reprezentace, podle které ho lze rychle najít.
NeoMME bylo proto od začátku navržené jako obousměrný encodér. Při zpracování může využívat informace z celé sekvence najednou, podobně jako klasické modely typu BERT. Rozdíl je v tom, že zde se stejným způsobem zpracovávají také obrazové patche.
Předtrénování probíhalo od začátku na přibližně 524 miliardách spojených tokenů, z nichž zhruba 290 miliard pocházelo z čistě textových dat. Trénink zahrnoval vícejazyčný text, kód, matematiku, běžné obrázky i obrazové dokumenty. Použit byl optimizátor NorMuon.
Významnou roli má také cíl založený na diskrétní maskované difúzi textu. Model se učí obnovovat zamaskované textové tokeny podle okolního textu a viditelných částí obrazu. Při 90procentním maskování přinesl tento přístup u varianty NeoMME-260M nárůst přesnosti odhadu maskovaných tokenů o 38,4 bodu.
NeoMME-Retriever spojuje dva typy vyhledávání
H Company vydala také varianty NeoMME-Retriever určené přímo pro vizuální vyhledávání v dokumentech. Jejich zajímavostí je, že při jednom průchodu modelem vytvářejí hustou reprezentaci i late-interaction reprezentaci.
Hustá reprezentace převede celý dokument nebo dotaz do jednoho kompaktního vektoru. To je praktické pro klasické vektorové databáze a rychlé předvýběry kandidátů. Late interaction je podrobnější přístup. Uchovává reprezentace jednotlivých textových tokenů a obrazových patchů, takže dokáže lépe zachytit lokální shodu mezi dotazem a konkrétní částí stránky.
V praxi lze oba přístupy kombinovat. Husté vektory nejprve rychle vyberou menší množství relevantních dokumentů. Late-interaction vrstva je potom přesněji seřadí. Jeden model tak může obsloužit jednodušší i náročnější variantu vyhledávání.
Benchmark: menší model poráží větší konkurenci
Na benchmarku ViDoRe v3 dosáhl NeoMME-Retriever-260M skóre 0,523 nDCG@10. Jde o nejlepší výsledek mezi hodnocenými modely s méně než 800 miliony parametrů. Varianta NeoMME-Retriever-800M dosáhla skóre 0,556.
Srovnání je zajímavé hlavně z pohledu velikosti. Model 260M se podle autorů dostal na podobnou úroveň jako ColQwen2.5, přestože používá přibližně čtrnáctkrát méně parametrů. NeoMME-800M se zase přiblížil modelu Vultron Retriever Flash s podobnou velikostí.
Na starších verzích benchmarku ViDoRe vychází NeoMME rovněž konkurenceschopně. Varianta 260M překonává ColModernVBERT i větší ColSmol-500M. Model 800M podle zveřejněné tabulky překonává ColPali v1.3, přestože má přibližně 3,6krát méně parametrů.
Je však fér dodat, že jde o specializované benchmarky pro vyhledávání ve vizuálních dokumentech. Výsledky nelze přímo srovnávat s chatboty a generativními modely od OpenAI, Googlu nebo Anthropicu. NeoMME není levnější náhradou za GPT, Gemini ani Claude. Je to spíše komponenta pro systém, který potřebuje najít správnou stránku nebo pasáž.
Rychlost a komprese řeší dvě praktické bolesti
Na GPU NVIDIA L40S při vstupu o rozlišení 2048 × 2048 zpracuje NeoMME-260M přibližně 51 stran za sekundu. To je zhruba dvojnásobná propustnost proti ColModernVBERT ve stejném testu.
Rychlost je důležitá hlavně při prvním indexování velkého archivu. Pokud má firma statisíce smluv, technických výkresů nebo faktur, model se musí nejprve prokousat každou stránkou. Každá ušetřená sekunda znamená méně času na GPU a nižší provozní náklady. Přesná cena ale záleží na použitém hardwaru, dávkování a způsobu nasazení.
Druhým problémem je velikost indexu. Late-interaction reprezentace jsou přesnější, ale ukládají mnohem více vektorů než klasické husté embeddingy. NeoMME proto využívá hierarchické poolingování tokenů a asymetrickou kvantizaci. Kombinací těchto metod lze embeddings zmenšit až 255krát při zachování více než 95 procent původní kvality nDCG@10.
V méně agresivním nastavení klesla velikost uložených dat podle autorů z přibližně 1,5 MB na stránku na 39 kB, tedy 39krát. Při agresivnější kompresi se lze dostat na 6 kB na stránku a zachovat více než 95 procent původní kvality. Pro velké firemní archivy to může být důležitější než samotný počet parametrů.
Dostupnost v Česku a cena
NeoMME je vydané jako open-source pod licencí Apache 2.0. Základní modely i varianty pro retrieval jsou dostupné přes Hugging Face a lze je provozovat lokálně nebo ve vlastním cloudovém prostředí. To je relevantní i pro české firmy, které nechtějí posílat interní smlouvy, technickou dokumentaci nebo účetní materiály do externího API.
Samostatná cena za API v době zveřejnění oznámení uvedena není. U základní varianty NeoMME-260M navíc Hugging Face uvádí, že model není přímo nasazený u inference providera. Náklady tak tvoří hlavně vlastní hardware, cloudový výpočet nebo služba, přes kterou si firma model zpřístupní.
Model je označovaný jako vícejazyčný, ale veřejné materiály neuvádějí samostatný certifikovaný benchmark pro češtinu. Pro české dokumenty tedy není rozumné automaticky předpokládat stejnou přesnost jako u angličtiny. Výhodou je dostupnost vah a možnost model otestovat na vlastních datech ještě před širším nasazením.
Co NeoMME skutečně mění
Největší význam NeoMME není v tom, že by nahradilo generativní AI. Zajímavé je spíše jako ukázka posunu od univerzálních multimodálních modelů k menším, účelově navrženým encodérům.
Pokud aplikace pouze hledá informace v dokumentech, generativní model může být zbytečně velký a drahý. NeoMME k takovému úkolu nepotřebuje generovat dlouhé odpovědi. Stačí mu dobře pochopit vztah mezi dotazem a stránkou, zachovat vizuální strukturu a nabídnout rychlou reprezentaci pro vyhledávání.
Pro vývojáře v Česku a EU je podstatná kombinace otevřené licence, relativně malé velikosti, podpory obrazových dokumentů a možnosti lokálního provozu. Limitem zůstává nutnost technického nasazení, absence hotové spotřebitelské aplikace a také fakt, že základní model není chatbot. NeoMME je nástroj pod kapotou. A právě tam může být užitečnější než další okno s blikajícím kurzorem.
FAQ
Lze NeoMME používat jako chatbot?
Ne. Základní NeoMME je encodér, který vytváří reprezentace textu a obrazu. Není určený ke generování konverzačních odpovědí. Pro vyhledávání v dokumentech je vhodnější varianta NeoMME-Retriever.
Je NeoMME dostupné v češtině?
Model je vícejazyčný a je dostupný ke stažení, ale zveřejněné materiály neuvádějí samostatné výsledky pro češtinu. Před nasazením na české dokumenty je proto vhodné ověřit přesnost na vlastním vzorku dat.
Kolik stojí používání NeoMME?
Modelové váhy jsou dostupné pod licencí Apache 2.0 bez uvedené ceny za API. Náklady vznikají při provozu na vlastním nebo cloudovém hardwaru. Veřejně dostupná základní varianta v době vydání nebyla nasazená u inference providera.