rakeaudio-asr Disponible
Les conversations sont aussi des documents.
Deux modèles ajustés en un seul pipeline. Un enregistrement entre, une transcription avec locuteurs identifiés et horodatage des mots en sort, et elle rejoint le même pipeline qu'un PDF analysé.
- Transcription
- 270x
- Temps réel. Un enregistrement de 10 minutes revient en 2,2 secondes.
- Avec locuteurs séparés
- 150x
- Le même fichier, 3,9 secondes. Une option à tous les volumes, pas un palier supérieur.
- Taux d'erreur sur les mots
- ~5 %
- Mesuré à l'interne selon la méthodologie anglaise d'Artificial Analysis.
- Par 1 000 minutes
- 5,00 $
- Un tarif unique à tous les volumes. Sans minimum.
01L'argument d'affaires
rakeaudio-asr
Une transcription que personne ne lit n'est pas un dossier.
La valeur d'un enregistrement tient à ce qui suit, et ce qui suit a une fenêtre. Ratez-la et la transcription devient une corvée de fin de quart.
02Le modèle
rakeaudio-asr
L'audio ne tient pas en place.
Une facture répète sa mise en page et un contrat a une structure fiable. Une conversation va où elle va, et le pipeline doit tenir quand même.
- Combien de personnes parlentUne API de transcription simple Un bloc de texte. Débrouillez-vous pour savoir qui a dit quoi, si tant est que le modèle propose les locuteurs.rakeaudio-asr Des étiquettes de locuteur et l'horodatage des mots, sur un enregistrement où des gens entrent et sortent en cours de route.
- Dans quelle langue c'estUne API de transcription simple Un champ de configuration, renvoyé vers vous, sur un fichier que personne n'a encore écouté.rakeaudio-asr La détection de la langue est incluse. Nous sommes à Montréal, où une phrase peut commencer dans une langue et finir dans une autre.
- Combien de temps vous attendezUne API de transcription simple De quatorze à vingt et une secondes sur un fichier de dix minutes, soit un traitement par lot avec des étapes en plus.rakeaudio-asr 2,2 secondes, ou 3,9 avec les locuteurs séparés. De cinq à dix fois plus rapide que les modèles d'OpenAI mesurés.
- Ce que vous obtenez au boutUne API de transcription simple Un fichier texte qu'il faut retrouver plus tard, dans un service qui ne fait rien d'autre.rakeaudio-asr Un document dans la même API que parse, extract, compose, redact et sign, prêt pour l'étape suivante.
03Spécification
rakeaudio-asr
Tout ce qu'il est, sur une page.
Un pipeline, un point de terminaison, un tarif. L'audio est plus lourd que le papier : l'exécution est asynchrone et le dit, plutôt que de garder une connexion ouverte.
Modèle
- Nom
- rakeaudio-asr
- Catégorie
- Pipeline de reconnaissance vocale Deux modèles que nous avons ajustés et combinés, derrière la capacité Parse.
- Tâche
- Transcription et séparation des locuteurs L'horodatage des mots et la détection de la langue sont inclus, pas des options.
- Langues
- Détectées, pas configurées Y compris un enregistrement qui change de langue au milieu d'une phrase.
Vitesse
- Transcription
- 270x le temps réel 2,2 secondes sur un fichier de 586 secondes à deux locuteurs.
- Avec diarisation
- 150x le temps réel 3,9 secondes sur le même fichier.
- Exactitude
- Environ 5 % de taux d'erreur sur les mots Une mesure interne selon la méthodologie anglaise d'Artificial Analysis, pas une soumission à un classement.
Interface
- Point de terminaison
- POST /v1/parse Le même appel qui lit un PDF. Un enregistrement est un autre type de fichier.
- Modes
- transcribe, transcribe_diarize Défini sur le fichier. Utilisez le premier quand les locuteurs ne sont pas nécessaires.
- Exécution
- Asynchrone Lancez la requête, puis interrogez l'exécution jusqu'à ce qu'elle quitte l'état processing.
Prix
- Transcription
- 5,00 $ par 1 000 minutes Le même tarif à tous les volumes, facturé à la minute d'audio plutôt qu'à la requête.
- Séparation des locuteurs
- Option En sus de ce poste, à tous les volumes. Le tarif figure sur la page des tarifs.
04Bancs d'essai
rakeaudio-asr
Assez rapide pour rester dans la conversation.
Il y a des flux où la qualité de la transcription est tout le travail et où personne n'attend. Et il y a ceux où la transcription est l'étape suivante d'une conversation qui vient d'avoir lieu. Ce modèle est fait pour les seconds.
- 270 x Temps réel, transcription Un enregistrement de 10 minutes en 2,2 secondes
- 150 x Temps réel, avec diarisation Le même fichier en 3,9 secondes, locuteurs séparés
- ~5% Taux d'erreur sur les mots À un point de Deepgram, mesuré à l'interne
- $5.00 Par 1 000 minutes Un tarif unique à tous les volumes, sans minimum
Vitesse sur un fichier de 10 minutes, en multiple du temps réel
- Deepgram Nova-3 300
- rakeaudio-asr le nôtre, transcription 270
- rakeaudio-asr, diarized le nôtre, locuteurs séparés 150
- Gemini 3.5 Transcribe 87
- OpenAI gpt-transcribe 42
- OpenAI gpt-4o-mini-transcribe 41
- OpenAI gpt-4o-transcribe 37
- OpenAI whisper-1 29
Audio préenregistré, en lot. Nos lignes proviennent d'une exécution interne à forte utilisation, sans démarrage à froid, sur un fichier de 586 secondes à deux locuteurs. Les lignes hébergées viennent des pages tarifaires des fournisseurs et du classement de reconnaissance vocale d'Artificial Analysis, mesurées sur un extrait de 10 minutes. Gemini 3.5 Transcribe est le pipeline le plus exact de cet ensemble avec 2,6 % d'erreur sur les mots, et Deepgram est plus rapide que nous. Nous préférons que vous testiez vos propres enregistrements plutôt que de croire ces chiffres sur parole.
05La partie difficile
rakeaudio-asr
Quelle version d'un fait est la bonne ?
Dans un document, la forme finale convenue se trouve généralement sur la page. Dans une conversation, non. Les idées sont soulevées, remaniées et abandonnées sans bruit, et la version qui compte est soit la plus récente, soit celle que personne n'a rejetée.
Aucune transcription ne tranche cela seule. Ce qu'elle peut faire, c'est donner au modèle suivant un relevé propre, attribué et horodaté sur lequel raisonner. C'est pourquoi les locuteurs et les temps font partie de la sortie plutôt que d'une version supérieure.
- Des locuteurs entrent et sortent dans le même enregistrement, et leur nombre n'est jamais connu d'avance.
- Une phrase peut commencer dans une langue et finir dans une autre : la langue ne peut donc pas être un champ de configuration.
- L'horodatage des mots ramène chaque affirmation à l'enregistrement, pour qu'un relecteur puisse aller écouter.
06Tarification
rakeaudio-asr
Un tarif, quel que soit le volume.
Facturé à la minute d'audio plutôt qu'à la requête : un message vocal de trente secondes et un conseil d'administration de deux heures coûtent le même prix à la minute. Aucun palier à négocier, aucun minimum à atteindre.
$ 5.00
par 1 000 minutes transcrites. Cela fait 300 $ pour mille heures de réunions, horodatage des mots et détection de la langue compris.
- Mille heures de réunions
- 300 $
- Séparation des locuteurs
- option, tout volume
- Horodatage des mots et détection de la langue
- inclus
- Minimums
- aucun
07Intégration
rakeaudio-asr
Un enregistrement est un autre type de fichier.
La transcription passe par le même appel qui lit un PDF. Envoyez un fichier, recevez une transcription avec locuteurs et horodatage, puis transmettez-la à n'importe quelle autre capacité du même pipeline. L'audio s'exécute de façon asynchrone : lancez la requête et interrogez l'exécution jusqu'à ce qu'elle quitte l'état processing.
curl -X POST https://api.cloudraker.com/v1/parse \
-H "Authorization: Bearer $CLOUDRAKER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"file": {"url": "https://example.com/consult.m4a", "processing": "transcribe_diarize"}}'
# Or with the CLI. Use "processing": "transcribe" when you do not need speaker labels.
paperwork parse --wait 0 \
--json '{"file": {"url": "https://example.com/consult.m4a", "processing": "transcribe_diarize"}}'08Questions
rakeaudio-asr
Des questions importantes, des réponses rapides.
Le taux d'erreur d'environ 5 % est-il une soumission à un banc d'essai ?
Non, et nous le précisons chaque fois. C'est une mesure interne selon la méthodologie anglaise d'Artificial Analysis, pas une exécution soumise à un classement. Gemini 3.5 Transcribe est plus exact avec 2,6 %. Testez vos propres enregistrements avant de vous engager.
Y a-t-il plus rapide ?
Deepgram Nova-3, à environ 300x le temps réel contre 270x pour nous. Nous sommes plus rapides que tout le reste mesuré, de cinq à dix fois face aux modèles d'OpenAI.
Dois-je indiquer la langue de l'enregistrement ?
Non. La détection de la langue est incluse, y compris pour les enregistrements qui changent de langue au milieu d'une phrase. Demander au client de configurer la langue d'un fichier que personne n'a écouté n'est pas une exigence réaliste.
Pourquoi la séparation des locuteurs est-elle une option plutôt qu'incluse ?
Parce qu'elle coûte du temps et du calcul réels, et que bien des flux n'en ont jamais besoin. En faire une option à tous les volumes garde le tarif de base stable, plutôt que d'intégrer la diarisation à chaque minute transcrite.
Puis-je utiliser la transcription avec le reste de l'API ?
C'est tout l'intérêt. Une transcription rejoint le même pipeline qu'un PDF analysé : extract, compose, redact et sign fonctionnent dessus sans intégration distincte.
rakeaudio-asr est l'un de trois.
La même infrastructure sous chacun. Choisissez le modèle qui correspond à l'entrée dont vous disposez.
Envoyez-nous les enregistrements qui le mettent en défaut.
Deux locuteurs qui se coupent la parole, une pièce à mauvaise acoustique, un appel qui change de langue en pleine phrase. C'est ainsi que la prochaine version sera entraînée.