Voici decision-machine-1 : un modèle de langage pour décider, pas pour rédiger

rakedoc-nano Disponible

Chaque élément, localisé.

Un modèle de vision de 1,2 milliard de paramètres qui transforme PDF, numérisations et dépôts réglementaires en markdown propre et en tableaux structurés, avec une boîte englobante sur chaque bloc produit. Pas seulement les images. Le texte aussi.

ParseBench, global
77,2
Premier parmi tous les modèles vision-langage, cinquième au total.
Par 1 000 pages
0,60 $
Au volume entreprise, et seulement sur les pages qui exigent un modèle.
Paramètres
1,2 G
Tourne sur tout GPU de 8 Go. Environ 6 pages par seconde sur un H100.
Poids
AGPL-3.0
Publiés sur Hugging Face. Exécutez-le dans votre propre périmètre.

01L'argument d'affaires

rakedoc-nano

Lire le document cesse d'être la partie coûteuse.

Chaque processus qui touche à la paperasse commence par la lire. La plupart des factures d'analyse facturent chaque page, qu'elle ait eu besoin d'un modèle ou non.

Trois pages sur quatre sont gratuites
PDF natifs, lettres et formulaires connus passent par un pipeline déterministe sans GPU. Vous payez le quart difficile, pas toute la pile.
Vérifiable, pas déclaré
77,2 au classement public ParseBench, premier parmi tous les modèles vision-langage. L'exécution, les réglages et les poids sont publiés.
Montrer la page
Une boîte sur chaque élément, cellules de tableau comprises. C'est ce qui permet de caviarder une clause, de citer une source ou de montrer la cellule exacte à un auditeur.
À vous de l'exécuter
Poids ouverts sous AGPL-3.0 sur une carte de 8 Go. Les documents n'ont jamais à quitter votre périmètre pour être lus.

02Le modèle

rakedoc-nano

Conçu pour les documents qui arrivent vraiment.

Les pages qui comptent en assurance, en santé, en droit et en services financiers sont celles qui portent un tableau de taux de trente colonnes et un en-tête à trois niveaux. C'est là que nous l'avons visé.

  • Un tableau dense à en-têtes fusionnés
    ROC générique Du texte dans l'ordre de lecture, la grille aplatie, la hiérarchie d'en-têtes perdue.
    rakedoc-nano 86,4 sur la dimension Tableaux, devant toutes les API d'analyse dédiées sauf une, avec la structure intacte.
  • Savoir d'où vient un nombre
    ROC générique Des boîtes sur les images et les tableaux, avec de la chance. Rien sur le texte.
    rakedoc-nano Une boîte sur chaque élément produit : paragraphes, titres, éléments de liste, cellules de tableau, figures, notes.
  • Ce que coûte une page
    ROC générique Chaque page facturée au tarif du modèle, y compris celles qui ont une couche de texte parfaitement lisible.
    rakedoc-nano Trois pages sur quatre n'atteignent jamais un modèle. Les autres coûtent 0,60 $ le millier au volume entreprise.
  • Où vont les documents
    ROC générique Un point de terminaison fermé, un score opaque, et vos dépôts sur le matériel d'un autre.
    rakedoc-nano Poids ouverts, une exécution de banc d'essai publiée, et vLLM sur votre propre GPU si la conformité l'exige.

03Spécification

rakedoc-nano

Tout ce qu'il est, sur une page.

Un modèle, une licence, un prix sur les pages qui l'exigent. La lignée est publiée, parce qu'un analyseur qu'on ne peut inspecter est un analyseur qu'il faut croire sur parole.

Modèle

Nom
rakedoc-nano
Catégorie
Analyseur vision-langage Conçu par CloudRaker, et le moteur derrière la capacité Parse.
Tâche
Analyse de documents Markdown, tableaux structurés, et une boîte englobante sur chaque élément.
Paramètres
1,2 milliard
Lignée
florin-parser-nano, sur KDL-Frontier-Parser-nano (Qwen2-VL) Un ajustement fin. Les deux parents sont sous AGPL-3.0.

Exécution

Licence
AGPL-3.0 Exécutez-le, inspectez-le, ajustez-le.
Auto-hébergé
vllm serve cloudraker/rakedoc-nano Tout GPU de 8 Go. Il tourne sans peine sur un L4 et descend à zéro.
Débit
Environ 6 pages par seconde En saturant un seul H100.
Hébergé
API Paperwork et votre espace de travail CloudRaker

Prix

Palier déterministe
0 $ Là où trois pages sur quatre sont traitées, sans aucun GPU.
Tarif courant
2,00 $ par 1 000 pages Facturé seulement sur les pages qui atteignent un modèle. Sans minimum.
Entreprise
0,60 $ par 1 000 pages Volume engagé et déploiements privés.

04Bancs d'essai

rakedoc-nano

L'analyseur est le nôtre. Les poids aussi.

rakedoc-nano est le modèle qui lit le quart difficile. Il est premier parmi tous les modèles vision-langage sur ParseBench (modèles propriétaires de pointe inclus), et il est publié sur Hugging Face sous AGPL-3.0, pour que vous puissiez le vérifier vous-même.

  • 77.2 ParseBench, global Premier parmi les VLM, cinquième au total
  • 1.2 B Paramètres Tourne sur tout GPU de 8 Go, ~6 pages/s sur un H100
  • $0.60 Par 1 000 pages Au volume entreprise; 2 $ au tarif courant, et seulement sur les pages qui exigent un modèle
  • AGPL-3.0 Poids ouverts Exécutez-le, inspectez-le, ajustez-le, gardez les documents dans votre périmètre

Score global ParseBench, classement, incluant notre soumission

  1. LlamaParse Cost Effective 80,6
  2. rakedoc-nano le nôtre, poids ouverts 77,2
  3. florin-parser-nano ouvert 76,7
  4. Gemini 3 Flash 75,1
  5. Reducto (Agentic) 73,0
  6. Fable 5 70,8
  7. Datalab Accurate 70,0
  8. Opus 4.8 63,7
  9. Azure Document Intelligence 59,6
  10. Google Document AI 50,4
  11. AWS Textract 47,9

rakedoc-nano, par dimension

  • 86,4 Tableaux Devant toutes les API d'analyse sauf une
  • 88,8 Fidélité du contenu À 3,5 points du meilleur du banc
  • 71,7 Mise en forme sémantique Sixième au total, troisième parmi les VLM
  • 74,3 Ancrage Les boîtes, évaluées
  • 64,9 Graphiques La dimension dont nous sommes le moins fiers

Chaque chiffre ici vient du classement public ParseBench, y compris notre propre soumission. Notre score est la moyenne de trois exécutions complètes sur un seul H100; l'écart entre exécutions est resté sous ±0,2 sur chaque dimension. Les modèles sans prix publié figurent quand même au graphique. Nous préférons que vous vérifiiez les chiffres plutôt que de nous croire sur parole.

05Ancrage

rakedoc-nano

L'analyse n'est pas finie quand le texte est juste.

Elle est finie quand vous pouvez pointer la page. rakedoc-nano renvoie une boîte englobante pour chaque élément produit, alors que la plupart des services n'encadrent que les images et les tableaux. Nous encadrons aussi le texte, jusqu'à la cellule de tableau.

Ce n'est pas un détail. C'est la différence entre un mur de markdown et un document sur lequel vos logiciels peuvent agir, et c'est la base du reste de l'API Paperwork.

  • Caviardez une clause à ses coordonnées, pas par une correspondance de texte qui peut échouer.
  • Signez à un point d'ancrage réellement présent sur la page, où que la mise en page l'ait placé.
  • Citez la région source dans une réponse de recherche, pour que le lecteur puisse la vérifier.
  • Montrez à un auditeur la cellule exacte d'où vient un nombre.

06Tarification

rakedoc-nano

La plupart des pages n'ont besoin d'aucun modèle.

PDF natifs avec couche de texte, lettres à une colonne, formulaires à gabarit connu. Notre pipeline déterministe les traite sans GPU et sans frais. Seul le reste difficile atteint rakedoc-nano.

75 %

des documents clients de CloudRaker sont passés par le pipeline déterministe gratuit le trimestre dernier. La plupart des API d'analyse les auraient toutes facturées.

Palier déterministe, par 1 000 pages
0,00 $
rakedoc-nano, tarif courant
2,00 $
rakedoc-nano, volume entreprise
0,60 $
Mixte à 75 / 25, entreprise
0,15 $

07Intégration

rakedoc-nano

Un appel, et la page revient lisible.

Parse tient en un appel à l'API Paperwork. Envoyez un fichier, recevez markdown, JSON structuré et boîtes englobantes. Les PDF natifs reviennent en ligne. Les numérisations passent par rakedoc-nano et prennent un peu plus de temps.

curl -X POST https://api.cloudraker.com/v1/parse \
  -H "Authorization: Bearer $CLOUDRAKER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"file": {"url": "https://example.com/rate-filing.pdf"}}'
import { CloudRakerClient } from "@cloudraker/api";

const client = new CloudRakerClient({ token: "YOUR_API_KEY" });

const run = await client.parse({
  body: {
    file: "{ url: \"https://www.irs.gov/pub/irs-pdf/fw9.pdf\", name: \"w9.pdf\" },"
  },
  output: "inline",
});

console.log(run.output?.markdown); // clean markdown, straight from the PDF
from cloudraker import V1ParseBodyFileName
from cloudraker.client import CloudRaker

client = CloudRaker(token="YOUR_API_KEY")

run = client.parse(
    file=V1ParseBodyFileName(url="https://www.irs.gov/pub/irs-pdf/fw9.pdf", name="w9.pdf"),
    output="inline",
)

print(run.output.markdown)  # clean markdown, straight from the PDF

08Questions

rakedoc-nano

Des questions importantes, des réponses rapides.

77,2, est-ce vraiment bon ?

C'est le premier parmi tous les modèles vision-langage sur ParseBench, modèles propriétaires de pointe inclus, et le cinquième au total derrière trois paliers gérés de LlamaParse et un modèle sans prix publié. Pour une fraction du coût de tout ce qui le précède.

Où est-il le plus faible ?

Les graphiques, à 64,9. Si vos documents sont surtout des présentations riches en graphiques plutôt que des dépôts et des formulaires, évaluez-le sur vos propres pages avant de vous engager.

Puis-je l'exécuter moi-même ?

Oui. Les poids sont sur Hugging Face sous AGPL-3.0 et il se sert avec vLLM sur tout GPU de 8 Go. À forte utilisation sur votre propre matériel, le coût marginal descend sous 0,30 $ par 1 000 pages.

Comment savoir quelles pages ont été facturées ?

Seules les pages qui atteignent un modèle sont facturées. Chaque exécution indique la route empruntée, de sorte que la répartition entre le palier gratuit et rakedoc-nano est visible par document plutôt qu'estimée.

Gère-t-il l'audio ?

Pas lui-même. Les enregistrements sont acheminés vers rakeaudio-asr, qui transcrit avec identification des locuteurs et renvoie la même forme, parce qu'une conversation est un document elle aussi.

Où aller ensuite

rakedoc-nano est l'un de trois.

La même infrastructure sous chacun. Choisissez le modèle qui correspond à l'entrée dont vous disposez.

decision-machine-1
Des décisions typées sur du texte en moins d'une seconde. Oui/non, classement, notation, réponse, extraction, entités et vérification, chacune avec une probabilité et sans rien générer.
Voir decision-machine-1
rakeaudio-asr
De la parole au texte avec identification des locuteurs, parce qu'une conversation est un document elle aussi. Les enregistrements reviennent dans la même forme qu'une page.
Voir rakeaudio-asr
Commencer

Envoyez-nous les documents qui font échouer.

Le palier gratuit couvre des milliers de pages par mois. Exécutez-le sur les pages que votre analyseur actuel rate, et dites-nous où il échoue. C'est ainsi que la prochaine version sera entraînée.