Voici decision-machine-1 : un modèle de langage pour décider, pas pour rédiger

rakeaudio-asr Disponible

Les conversations sont aussi des documents.

Deux modèles ajustés en un seul pipeline. Un enregistrement entre, une transcription avec locuteurs identifiés et horodatage des mots en sort, et elle rejoint le même pipeline qu'un PDF analysé.

Transcription
270x
Temps réel. Un enregistrement de 10 minutes revient en 2,2 secondes.
Avec locuteurs séparés
150x
Le même fichier, 3,9 secondes. Une option à tous les volumes, pas un palier supérieur.
Taux d'erreur sur les mots
~5 %
Mesuré à l'interne selon la méthodologie anglaise d'Artificial Analysis.
Par 1 000 minutes
5,00 $
Un tarif unique à tous les volumes. Sans minimum.

01L'argument d'affaires

rakeaudio-asr

Une transcription que personne ne lit n'est pas un dossier.

La valeur d'un enregistrement tient à ce qui suit, et ce qui suit a une fenêtre. Ratez-la et la transcription devient une corvée de fin de quart.

Encore dans la pièce
Une consultation de dix minutes revient en quelques secondes : le praticien corrige et signe avant le patient suivant, pas en fin de journée.
Qui l'a dit
La séparation des locuteurs est une option à tous les volumes. Trois des quatre modèles d'OpenAI ne l'offrent pas, et celui qui l'offre exige un modèle distinct.
Un tarif, tout volume
5,00 $ par 1 000 minutes, facturé à la minute d'audio plutôt qu'à la requête. Mille heures de réunions coûtent 300 $.
Puis elle continue de servir
La transcription rejoint le même pipeline qu'un PDF analysé. Extraire les décisions, composer le résumé, caviarder les noms, envoyer pour signature.

02Le modèle

rakeaudio-asr

L'audio ne tient pas en place.

Une facture répète sa mise en page et un contrat a une structure fiable. Une conversation va où elle va, et le pipeline doit tenir quand même.

  • Combien de personnes parlent
    Une API de transcription simple Un bloc de texte. Débrouillez-vous pour savoir qui a dit quoi, si tant est que le modèle propose les locuteurs.
    rakeaudio-asr Des étiquettes de locuteur et l'horodatage des mots, sur un enregistrement où des gens entrent et sortent en cours de route.
  • Dans quelle langue c'est
    Une API de transcription simple Un champ de configuration, renvoyé vers vous, sur un fichier que personne n'a encore écouté.
    rakeaudio-asr La détection de la langue est incluse. Nous sommes à Montréal, où une phrase peut commencer dans une langue et finir dans une autre.
  • Combien de temps vous attendez
    Une API de transcription simple De quatorze à vingt et une secondes sur un fichier de dix minutes, soit un traitement par lot avec des étapes en plus.
    rakeaudio-asr 2,2 secondes, ou 3,9 avec les locuteurs séparés. De cinq à dix fois plus rapide que les modèles d'OpenAI mesurés.
  • Ce que vous obtenez au bout
    Une API de transcription simple Un fichier texte qu'il faut retrouver plus tard, dans un service qui ne fait rien d'autre.
    rakeaudio-asr Un document dans la même API que parse, extract, compose, redact et sign, prêt pour l'étape suivante.

03Spécification

rakeaudio-asr

Tout ce qu'il est, sur une page.

Un pipeline, un point de terminaison, un tarif. L'audio est plus lourd que le papier : l'exécution est asynchrone et le dit, plutôt que de garder une connexion ouverte.

Modèle

Nom
rakeaudio-asr
Catégorie
Pipeline de reconnaissance vocale Deux modèles que nous avons ajustés et combinés, derrière la capacité Parse.
Tâche
Transcription et séparation des locuteurs L'horodatage des mots et la détection de la langue sont inclus, pas des options.
Langues
Détectées, pas configurées Y compris un enregistrement qui change de langue au milieu d'une phrase.

Vitesse

Transcription
270x le temps réel 2,2 secondes sur un fichier de 586 secondes à deux locuteurs.
Avec diarisation
150x le temps réel 3,9 secondes sur le même fichier.
Exactitude
Environ 5 % de taux d'erreur sur les mots Une mesure interne selon la méthodologie anglaise d'Artificial Analysis, pas une soumission à un classement.

Interface

Point de terminaison
POST /v1/parse Le même appel qui lit un PDF. Un enregistrement est un autre type de fichier.
Modes
transcribe, transcribe_diarize Défini sur le fichier. Utilisez le premier quand les locuteurs ne sont pas nécessaires.
Exécution
Asynchrone Lancez la requête, puis interrogez l'exécution jusqu'à ce qu'elle quitte l'état processing.

Prix

Transcription
5,00 $ par 1 000 minutes Le même tarif à tous les volumes, facturé à la minute d'audio plutôt qu'à la requête.
Séparation des locuteurs
Option En sus de ce poste, à tous les volumes. Le tarif figure sur la page des tarifs.

04Bancs d'essai

rakeaudio-asr

Assez rapide pour rester dans la conversation.

Il y a des flux où la qualité de la transcription est tout le travail et où personne n'attend. Et il y a ceux où la transcription est l'étape suivante d'une conversation qui vient d'avoir lieu. Ce modèle est fait pour les seconds.

  • 270 x Temps réel, transcription Un enregistrement de 10 minutes en 2,2 secondes
  • 150 x Temps réel, avec diarisation Le même fichier en 3,9 secondes, locuteurs séparés
  • ~5% Taux d'erreur sur les mots À un point de Deepgram, mesuré à l'interne
  • $5.00 Par 1 000 minutes Un tarif unique à tous les volumes, sans minimum

Vitesse sur un fichier de 10 minutes, en multiple du temps réel

  1. Deepgram Nova-3 300
  2. rakeaudio-asr le nôtre, transcription 270
  3. rakeaudio-asr, diarized le nôtre, locuteurs séparés 150
  4. Gemini 3.5 Transcribe 87
  5. OpenAI gpt-transcribe 42
  6. OpenAI gpt-4o-mini-transcribe 41
  7. OpenAI gpt-4o-transcribe 37
  8. OpenAI whisper-1 29

Audio préenregistré, en lot. Nos lignes proviennent d'une exécution interne à forte utilisation, sans démarrage à froid, sur un fichier de 586 secondes à deux locuteurs. Les lignes hébergées viennent des pages tarifaires des fournisseurs et du classement de reconnaissance vocale d'Artificial Analysis, mesurées sur un extrait de 10 minutes. Gemini 3.5 Transcribe est le pipeline le plus exact de cet ensemble avec 2,6 % d'erreur sur les mots, et Deepgram est plus rapide que nous. Nous préférons que vous testiez vos propres enregistrements plutôt que de croire ces chiffres sur parole.

05La partie difficile

rakeaudio-asr

Quelle version d'un fait est la bonne ?

Dans un document, la forme finale convenue se trouve généralement sur la page. Dans une conversation, non. Les idées sont soulevées, remaniées et abandonnées sans bruit, et la version qui compte est soit la plus récente, soit celle que personne n'a rejetée.

Aucune transcription ne tranche cela seule. Ce qu'elle peut faire, c'est donner au modèle suivant un relevé propre, attribué et horodaté sur lequel raisonner. C'est pourquoi les locuteurs et les temps font partie de la sortie plutôt que d'une version supérieure.

  • Des locuteurs entrent et sortent dans le même enregistrement, et leur nombre n'est jamais connu d'avance.
  • Une phrase peut commencer dans une langue et finir dans une autre : la langue ne peut donc pas être un champ de configuration.
  • L'horodatage des mots ramène chaque affirmation à l'enregistrement, pour qu'un relecteur puisse aller écouter.

06Tarification

rakeaudio-asr

Un tarif, quel que soit le volume.

Facturé à la minute d'audio plutôt qu'à la requête : un message vocal de trente secondes et un conseil d'administration de deux heures coûtent le même prix à la minute. Aucun palier à négocier, aucun minimum à atteindre.

$ 5.00

par 1 000 minutes transcrites. Cela fait 300 $ pour mille heures de réunions, horodatage des mots et détection de la langue compris.

Mille heures de réunions
300 $
Séparation des locuteurs
option, tout volume
Horodatage des mots et détection de la langue
inclus
Minimums
aucun

07Intégration

rakeaudio-asr

Un enregistrement est un autre type de fichier.

La transcription passe par le même appel qui lit un PDF. Envoyez un fichier, recevez une transcription avec locuteurs et horodatage, puis transmettez-la à n'importe quelle autre capacité du même pipeline. L'audio s'exécute de façon asynchrone : lancez la requête et interrogez l'exécution jusqu'à ce qu'elle quitte l'état processing.

cURL
curl -X POST https://api.cloudraker.com/v1/parse \
  -H "Authorization: Bearer $CLOUDRAKER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"file": {"url": "https://example.com/consult.m4a", "processing": "transcribe_diarize"}}'

# Or with the CLI. Use "processing": "transcribe" when you do not need speaker labels.
paperwork parse --wait 0 \
  --json '{"file": {"url": "https://example.com/consult.m4a", "processing": "transcribe_diarize"}}'

08Questions

rakeaudio-asr

Des questions importantes, des réponses rapides.

Le taux d'erreur d'environ 5 % est-il une soumission à un banc d'essai ?

Non, et nous le précisons chaque fois. C'est une mesure interne selon la méthodologie anglaise d'Artificial Analysis, pas une exécution soumise à un classement. Gemini 3.5 Transcribe est plus exact avec 2,6 %. Testez vos propres enregistrements avant de vous engager.

Y a-t-il plus rapide ?

Deepgram Nova-3, à environ 300x le temps réel contre 270x pour nous. Nous sommes plus rapides que tout le reste mesuré, de cinq à dix fois face aux modèles d'OpenAI.

Dois-je indiquer la langue de l'enregistrement ?

Non. La détection de la langue est incluse, y compris pour les enregistrements qui changent de langue au milieu d'une phrase. Demander au client de configurer la langue d'un fichier que personne n'a écouté n'est pas une exigence réaliste.

Pourquoi la séparation des locuteurs est-elle une option plutôt qu'incluse ?

Parce qu'elle coûte du temps et du calcul réels, et que bien des flux n'en ont jamais besoin. En faire une option à tous les volumes garde le tarif de base stable, plutôt que d'intégrer la diarisation à chaque minute transcrite.

Puis-je utiliser la transcription avec le reste de l'API ?

C'est tout l'intérêt. Une transcription rejoint le même pipeline qu'un PDF analysé : extract, compose, redact et sign fonctionnent dessus sans intégration distincte.

Où aller ensuite

rakeaudio-asr est l'un de trois.

La même infrastructure sous chacun. Choisissez le modèle qui correspond à l'entrée dont vous disposez.

rakedoc-nano
Un modèle de vision à poids ouverts pour l'analyse de documents. Markdown propre, tableaux structurés et une boîte englobante sur chaque élément produit, jusqu'à la cellule de tableau.
Voir rakedoc-nano
decision-machine-1
Des décisions typées sur du texte en moins d'une seconde. Oui/non, classement, notation, réponse, extraction, entités et vérification, chacune avec une probabilité et sans rien générer.
Voir decision-machine-1
Commencer

Envoyez-nous les enregistrements qui le mettent en défaut.

Deux locuteurs qui se coupent la parole, une pièce à mauvaise acoustique, un appel qui change de langue en pleine phrase. C'est ainsi que la prochaine version sera entraînée.