Voici rakedoc-nano : le VLM à poids ouverts à la fine pointe pour l’analyse de documents
Un analyseur visuel de 1,2 milliard de paramètres derrière l’API Paperwork de CloudRaker. À la fine pointe des modèles à poids ouverts, des boîtes englobantes sur chaque élément, et un tarif entreprise de 0,60 $ par 1 000 pages.
- N° 1 parmi les VLM sur ParseBench.
rakedoc-nanoobtient un score global de 77,2 au classement ParseBench : premier parmi tous les modèles vision-langage, modèles frontières propriétaires inclus, et cinquième au global, à une fraction du prix de tout ce qui le dépasse. - Conscient de l’espace, jusqu’au bout. Des boîtes englobantes pour chaque élément, blocs de texte et cellules de tableaux inclus, pas seulement les images et les tableaux. La structure survit jusqu’à la recherche, l’ancrage, le caviardage et l’audit.
- Poids ouverts. Publié sur Hugging Face sous licence AGPL-3.0 : vous pouvez l’exécuter, l’inspecter, l’ajuster finement et garder vos documents à l’intérieur de votre périmètre.
- 0,60 $ par 1 000 pages au volume entreprise. Le tarif courant est de 2 $ par 1 000 pages, facturé seulement sur les pages qui ont besoin d’un modèle — trois pages sur quatre passent par le palier gratuit à base de règles, tout compris.
- Fonctionne partout. Offert dès aujourd’hui dans l’API Paperwork et votre espace de travail CloudRaker, ou auto-hébergé avec vLLM sur n’importe quel GPU avec 8 Go de mémoire.
Aujourd’hui, au jour un de la semaine de lancement CloudRaker, nous publions rakedoc-nano, le modèle compact d’analyse de documents derrière la capacité Parse de l’API Paperwork de CloudRaker. Il transforme les PDF, les numérisations et les dépôts réglementaires en Markdown propre, en tableaux structurés et en boîtes englobantes pour chaque élément. À partir de maintenant, il est à vous aussi : poids ouverts, harnais de banc d’essai publié, et un pipeline tarifé pour tout traiter.
Nous bâtissons la pile agentique de paperasse pour l’entreprise : assurance, santé, juridique, services financiers. Les documents qui comptent le plus pour nos clients sont ceux avec un tableau de taux de 30 colonnes et un en-tête à trois niveaux, et ceux où un auditeur demande d’où vient un chiffre. C’est exactement là que nous avons concentré nos efforts, et ça paraît dans les chiffres. Utilisé comme étape de prétraitement, rakedoc-nano réduit aussi le nombre de jetons dont les modèles en aval ont besoin pour compléter un flux de travail, et ses boîtes englobantes leur permettent de localiser n’importe quel mot sur la page.
Performance
rakedoc-nano est le VLM d’analyse de documents à poids ouverts à la fine pointe sur ParseBench. Il obtient un score global de 77,2 : premier parmi tous les modèles vision-langage, modèles frontières propriétaires inclus, et cinquième au global, derrière seulement les trois paliers gérés de LlamaParse et oi-parser. Chaque chiffre de ce billet provient du classement ParseBench, y compris notre soumission (PR #120), qui place rakedoc-nano dans le quadrant le plus avantageux de la carte prix-performance : une exactitude proche de la frontière à un prix de commodité.
rakedoc-nano est le plus fort là où les documents d’entreprise sont les plus difficiles : le formatage sémantique (titres, gras, exposants, la structure qui rend un document analysé utilisable en aval), où il obtient 71,7 — sixième sur tout le classement, troisième parmi les VLM, à égalité avec Opus 4.8 — et la fidélité au contenu, à 88,8, à 3,5 points du meilleur score du banc. Sur les trois dimensions qui comptent le plus pour les dépôts réglementaires (tableaux, fidélité au contenu, formatage sémantique), il devance chaque API d’analyse dédiée sauf les paliers agentiques de LlamaParse.
Par dimension
| Modèle | Global | Tableaux | Graphiques | Contenu | Sémantique | Ancrage |
|---|---|---|---|---|---|---|
| LlamaParse Cost Effective | 80,6 | 84,2 | 77,9 | 89,9 | 67,3 | 83,8 |
| rakedoc-nano | 77,2 | 86,4 | 64,9 | 88,8 | 71,7 | 74,3 |
| florin-parser-nano (ouvert) | 76,7 | 86,1 | 65,2 | 87,4 | 70,6 | 74,1 |
| Gemini 3 Flash (Thinking High) | 75,1 | 91,5 | 64,8 | 90,9 | 68,3 | 59,8 |
| Reducto (Agentic) | 73,0 | 80,4 | 73,4 | 86,4 | 57,6 | 67,1 |
| Fable 5 | 70,8 | 89,8 | 52,2 | 90,0 | 72,6 | 49,2 |
| Chandra OCR 2 (ouvert) | 70,1 | 89,2 | 65,1 | 83,7 | 61,4 | 51,2 |
| Datalab Accurate | 70,0 | 90,3 | 62,4 | 83,9 | 40,8 | 72,4 |
| Opus 4.8 | 63,7 | 89,7 | 49,8 | 89,0 | 71,4 | 18,7 |
| Azure Document Intelligence | 59,6 | 86,0 | 1,6 | 84,9 | 51,9 | 73,8 |
| Google Document AI | 50,4 | 55,1 | 1,4 | 83,7 | 50,5 | 61,3 |
| AWS Textract | 47,9 | 84,6 | 6,0 | 74,8 | 3,7 | 70,4 |
Notre score soumis est la moyenne de trois exécutions complètes de ParseBench sur un seul H100; l’écart entre les exécutions était de ±0,2 sur chaque dimension. Chaque chiffre est reproductible à partir de la PR de soumission et des réglages de la fiche du modèle.
Débit
rakedoc-nano est petit par conception, et petit veut dire rapide. À 1,2 milliard de paramètres, il sature un seul H100 à environ 6 pages/s et tient sur n’importe quelle carte avec 8 Go de mémoire. Il roule aussi confortablement sur un L4, et sa petite empreinte le rend efficace dans les environnements sans serveur : il redescend à zéro avec un démarrage à froid minimal.
Chaque élément, localisé
L’analyse pour le travail en entreprise n’est pas terminée quand le texte est bon. Elle est terminée quand vous pouvez pointer la page. rakedoc-nano retourne une boîte englobante pour chaque élément qu’il émet : paragraphes, titres, éléments de liste, cellules de tableaux, figures, notes de bas de page. C’est ce qui permet à l’API Paperwork de caviarder une clause, de signer à un point d’ancrage, de citer une région source dans une réponse de recherche, ou de montrer à un auditeur la cellule exacte d’où vient un chiffre. La plupart des services d’analyse n’encadrent que les images et les tableaux; nous encadrons aussi le texte.
Un palier gratuit qui fait le gros du travail
Voici la partie qui nous emballe le plus. La plupart des documents n’ont pas besoin d’un modèle de vision du tout. PDF natifs avec couche de texte, lettres à une seule colonne, formulaires à gabarits connus : notre pipeline gratuit à base de règles les traite sans GPU. Nous traitons déjà des dizaines de millions de pages chaque mois. Sur le trafic des clients CloudRaker au dernier trimestre, 75 % des documents sont passés par le pipeline déterministe. Seuls les 25 % difficiles (numérisations, tableaux denses, dépôts multicolonnes) atteignent l’OCR et rakedoc-nano.
La plupart des API d’analyse facturent chaque page. CloudRaker facture les pages qui ont besoin d’un modèle, à 2 $ par 1 000 pages au tarif courant ou 0,60 $ par 1 000 pages au volume entreprise.
| Palier | Par 1 000 pages | Mixte à 75 / 25 | Mixte à 50 / 50 |
|---|---|---|---|
| Gratuit (pipeline à base de règles) | 0,00 $ | — | — |
rakedoc-nano, tarif courant |
2,00 $ | 0,50 $ | 1,00 $ |
rakedoc-nano, entreprise |
0,60 $ | 0,15 $ | 0,30 $ |
| LlamaParse Cost Effective | 3,75 $ | 3,75 $ | 3,75 $ |
Tout compris : la détection de mise en page, la structure des tableaux, les boîtes englobantes, l’aiguillage vers le palier gratuit et l’hébergement sont inclus; aucun supplément par fonctionnalité, aucun minimum au tarif courant. Le tarif entreprise s’applique aux volumes engagés et aux déploiements privés. Auto-hébergé sur votre propre GPU à haute utilisation, le coût marginal du modèle descend sous 0,30 $ par 1 000 pages.
Ce que vous pouvez bâtir avec
- Traitement automatisé de documents. Extrayez les tableaux des dépôts de taux, des états financiers et des annexes avec les en-têtes fusionnés intacts. C’est là que l’ajustement fin a fait bouger l’aiguille : les correspondances parfaites de tableaux sont passées de 58 % à 61 % de l’ensemble du banc d’essai.
- Recherche ancrée. Du Markdown propre en sortie, des tableaux en HTML, chaque segment lié à une boîte sur une page, et rien ne quitte votre VPC.
- Paperasse agentique. Parse est la première étape d’Extract, Compose, Redact, Fill, Redline et Sign dans l’API Paperwork et la trousse agentique pour Claude et ChatGPT. Même contrat de sortie que le pipeline KDL : les intégrations existantes fonctionnent sans changement.
Ouvert par défaut
rakedoc-nano est livré sous AGPL-3.0. Nous publions les poids, la lignée, le commit exact du banc d’essai et ses réglages, et le bruit entre exécutions que nous avons mesuré (±0,2). Nous préférons que vous vérifiiez nos chiffres plutôt que de nous croire sur parole.
Pour commencer
Parse, c’est un seul appel à l’API Paperwork. Envoyez un fichier, recevez du Markdown, du JSON structuré et des boîtes englobantes. Les PDF natifs reviennent en ligne; les numérisations sont aiguillées vers rakedoc-nano et prennent un peu plus de temps.
curl -X POST https://api.cloudraker.com/v1/parse \
-H "Authorization: Bearer $CLOUDRAKER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"file": {"url": "https://example.com/rate-filing.pdf"}}'
Ou avec le CLI :
paperwork parse --output inline \
--json '{"file": {"url": "https://example.com/rate-filing.pdf"}}'
Référence complète, moteurs et interrogation pour les longues numérisations : docs.cloudraker.com. Tarifs : cloudraker.com/pricing. Obtenez une clé API à signup.cloudraker.com : le palier gratuit permanent couvre des milliers de pages chaque mois.
Envoyez-nous les documents qui cassent. C’est comme ça que la prochaine version s’entraîne.
C’est le jour un de la semaine de lancement. D’autres nouveautés s’en viennent sur toute la pile de paperasse : analyse, extraction, remplissage de formulaires, génération de documents et signature.
Poids et fiche du modèle : huggingface.co/cloudraker/rakedoc-nano.
Arbre du modèle. rakedoc-nano est un ajustement fin de florin-parser-nano, bâti sur KDL-Frontier-Parser-nano (Qwen2-VL, 1,2 milliard de paramètres). Les deux sont AGPL-3.0. Servez avec vllm serve cloudraker/rakedoc-nano --served-model-name kdl-frontier-parser-nano --trust-remote-code.