Voici RakeSign: la signature de documents gratuite et illimitée

Voici rakeaudio-asr : les conversations sont aussi des documents

Le pipeline audio derrière l’API Paperwork de CloudRaker. Transcription à 270x le temps réel, séparation des locuteurs à 150x, un seul tarif à tous les volumes.

Retour aux notes
Points saillants
  • 270x le temps réel. Un enregistrement de 10 minutes se transcrit en 2,2 secondes. Une seule API hébergée mesurée est plus rapide.
  • Locuteurs séparés à 150x. Même fichier, 3,9 secondes, avec diarisation. Offerte en option à tous les volumes, pas un palier supérieur.
  • ~5 % de WER. Mesuré à l’interne selon la méthodologie anglaise d’Artificial Analysis, dans la fourchette des pipelines les plus précis du marché.
  • 5,00 $ par 1 000 minutes. Un seul tarif à tous les volumes, avec l’horodatage des mots et la détection de la langue inclus.
  • Branché sur le reste de la pile. Une transcription entre dans le même pipeline qu’un PDF analysé : extraire, composer, caviarder, signer.

Une partie de la paperasse la plus difficile que traitent nos clients commence par une conversation. Une salle de réunion où une stratégie financière se débat. Un agent de location et un nouveau locataire qui s’entendent sur les conditions. Une consultation clinique où un praticien écoute un patient et s’en occupe en même temps.

Pour nous, une conversation est un autre type de document. Nous avons donc investi dans le volet audio de l’API Paperwork comme nous avons investi dans le reste. Aujourd’hui, nous publions le premier résultat : rakeaudio-asr, deux modèles que nous avons ajustés et combinés en un seul pipeline. Il transforme un enregistrement en transcription avec étiquettes de locuteurs et horodatage, et cette transcription entre dans le même pipeline qu’un PDF analysé : extraire, composer, caviarder, signer.

Ce que l’audio casse

Une facture répète sa mise en page. Un contrat a une structure sur laquelle on peut compter. Une conversation va où elle veut. Le nombre de locuteurs varie, et des gens arrivent et partent à l’intérieur du même enregistrement.

Puis il y a le problème plus difficile. Dans un document, la forme finale convenue d’une chose est habituellement là, sur la page. Dans une conversation, les idées et les décisions se remanient, et il faut déterminer quelle version d’un fait est la vraie : la déclaration la plus récente, ou celle que personne n’a rejetée.

Avant qu’un modèle puisse faire ce raisonnement, l’audio doit être traité, et le traitement audio a ses propres contraintes. Les fichiers sont plus lourds que des documents. Les modèles ont une plus grande empreinte. Et nous sommes à Montréal, où la plupart des gens parlent au moins deux langues : une phrase peut commencer dans une langue et finir dans une autre, et on ne peut souvent pas savoir dans quelle langue est un enregistrement sans l’écouter. La langue n’est pas quelque chose qu’on peut renvoyer au client comme champ de configuration.

La vitesse, c’est la fonctionnalité

Il y a des flux de travail où la qualité de la transcription est tout le travail et où personne n’attend. Puis il y a ceux où la transcription est la prochaine étape d’une conversation qui vient de se terminer.

Une consultation entre un médecin et une infirmière se termine. Les deux doivent lire ce qui a été dit, le corriger et l’approuver avant de passer au patient suivant. Attendre cinq minutes pour une transcription propre, attribuée par locuteur, veut dire que la révision ne se fait pas. Elle est reportée à la fin du quart, ou elle est sautée.

rakeaudio-asr retourne un enregistrement de 10 minutes en 2,2 secondes, ou 3,9 secondes avec les locuteurs séparés. C’est assez rapide pour que la transcription reste dans la conversation au lieu de devenir une corvée pour plus tard.

Banc d’essai

Audio en lot et préenregistré. Nos chiffres proviennent d’une exécution interne à haute utilisation, sans démarrage à froid, sur un fichier de 586 secondes à deux locuteurs. Les chiffres des services hébergés proviennent des pages de tarification des fournisseurs et du classement reconnaissance vocale d’Artificial Analysis, mesurés sur un extrait de 10 minutes.

Figure 1. Vitesse sur un fichier de 10 minutes, en multiple du temps réel. Nos deux lignes sont les exécutions transcription seule et diarisée; les lignes hébergées proviennent du classement d’Artificial Analysis.

Par modèle

Modèle Par 1 000 min Diarisation Fichier de 10 min WER (EN)
rakeaudio-asr 5,00 $ En option 2,2 s (270x) / 3,9 s diarisé (150x) ~5 %
Deepgram Nova-3 4,30 $ mono / 5,20 $ multi Incluse ~2 s (300x) 5,2 %
Gemini 3.5 Transcribe 5,00 $ mixte Incluse, jusqu’à 8 locuteurs ~7 s (87x) 2,6 %
OpenAI gpt-transcribe 4,50 $ Non offerte ~14 s (42x) 3,3 %
OpenAI gpt-4o-mini-transcribe 3,00 $ Non offerte ~15 s (41x) 4,5 %
OpenAI gpt-4o-transcribe 6,00 $ 6,00 $, modèle distinct ~16 s (37x) 4,0 %
OpenAI whisper-1 6,00 $ Non offerte ~21 s (29x) 4,1 %

Trois choses que ce tableau dit. Deepgram est plus rapide que nous, et nous sommes plus rapides que tout le reste, de cinq à dix fois face aux modèles d’OpenAI. Gemini 3.5 Transcribe est le pipeline le plus précis ici, et notre taux d’erreur se situe à moins d’un point de celui de Deepgram. Et la diarisation ne va pas de soi : trois des quatre modèles d’OpenAI ne l’offrent pas du tout, et celui qui l’offre exige un modèle distinct. Nous l’offrons en option à tous les volumes.

Notre ~5 % est une mesure interne selon la méthodologie anglaise d’Artificial Analysis, pas une soumission au classement. Nous le dirons chaque fois que nous citerons ce chiffre, et nous préférons que vous testiez vos propres fichiers plutôt que de nous croire sur parole.

Tarification

5,00 $ par 1 000 minutes d’audio transcrit, à tous les volumes. Ça fait 300 $ pour mille heures de réunions. La séparation des locuteurs est une option qui s’ajoute à cette ligne; le tarif est sur la page de tarification.

Tout compris : l’horodatage des mots, la détection de la langue et l’hébergement sont inclus; aucun minimum. La transcription est facturée à la minute d’audio, pas à la requête, alors les courts extraits et les longs enregistrements coûtent le même prix à la minute.

Ce que vous pouvez bâtir

rakeaudio-asr vit dans la même API que parse, extract, compose, redact et sign, alors un enregistrement devient un document de travail plutôt qu’un fichier texte qu’il faut aller retrouver plus tard.

  • Des notes de réunion qui se font réviser. Transcrire, séparer les locuteurs, résumer les décisions, envoyer le résumé pour signature pendant que la salle est encore chaude.
  • Documentation clinique. Une consultation devient une note structurée qu’un praticien corrige et signe avant le patient suivant.
  • Registres de négociation. Un appel de location ou de renouvellement, attribué par locuteur, classé avec le contrat qu’il a produit.

Des exemples de code pour ces cas sont dans notre documentation. Une équipe a bâti un résumeur de notes de réunion fonctionnel sur le pipeline en moins de deux heures.

Pour commencer

La transcription, c’est un seul appel à l’API Paperwork. Envoyez un fichier, recevez une transcription avec étiquettes de locuteurs et horodatage, puis passez-la à n’importe quelle autre capacité du même pipeline. L’audio s’exécute de façon asynchrone : lancez la requête, puis interrogez l’exécution jusqu’à ce qu’elle quitte processing.

curl -X POST https://api.cloudraker.com/v1/parse \
  -H "Authorization: Bearer $CLOUDRAKER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"file": {"url": "https://example.com/consultation.m4a", "processing": "transcribe_diarize"}}'

Ou avec la CLI :

paperwork parse --wait 0 \
  --json '{"file": {"url": "https://example.com/consultation.m4a", "processing": "transcribe_diarize"}}'

Utilisez "processing": "transcribe" quand vous n’avez pas besoin des étiquettes de locuteurs. Référence complète et interrogation pour les longs enregistrements : docs.cloudraker.com. Tarification : cloudraker.com/pricing. Obtenez une clé d’API à signup.cloudraker.com.

Envoyez-nous les enregistrements qui le cassent. Deux locuteurs qui parlent en même temps, une salle avec une mauvaise acoustique, un appel qui change de langue au milieu d’une phrase. C’est comme ça que la prochaine version s’entraîne.