Le pipeline
Tout commence par un seul flux audio et se termine sur l'appareil de chaque auditeur, en parallèle pour chaque langue :
- 1
Son de la scène
Un flux depuis votre console de son - autant de microphones, de tables rondes et de sources de diffusion que nécessaire, mixés par votre ingénieur exactement comme aujourd'hui.
- 2
Reconnaissance vocale
La reconnaissance en flux continu, sensible aux phrases, attend que les phrases se stabilisent, afin que le traducteur reçoive des phrases complètes et abouties plutôt que des fragments.
- 3
Traduction IA
La traduction sensible au contexte conserve le fil de l'intervention et respecte le glossaire et la terminologie de votre événement.
- 4
Voix neuronale
Une voix neuronale naturelle s'exprime dans chaque langue cible en parallèle, un canal par langue.
- 5
Diffusion
L'audio et les sous-titres en direct parviennent à chaque auditeur via WebRTC - téléphones dans la salle, navigateurs à distance, écrans du lieu et outils de production.
Le délai de bout en bout est généralement d'environ 5 secondes entre la phrase prononcée et la voix interprétée. La plateforme le mesure en continu : après chaque session, vous recevez un rapport de latence par langue (médiane et p99), pour une qualité vérifiée par les données et non par impression.
Moteurs et voix
Interpretwise s'appuie en coulisses sur plusieurs moteurs de reconnaissance vocale, de traduction et de synthèse vocale, et choisit la meilleure combinaison pour chaque paire de langues, avec bascule automatique entre moteurs en cours de session. Les voix se déclinent en deux niveaux :
- Voix Premium - L'option la plus naturelle, recommandée pour les contenus de scène.
- Voix Standard - Un vaste catalogue couvrant toute la gamme de langues à un tarif plus bas.
L'intervention humaine
Un même événement peut combiner interprétation IA et interprètes humains professionnels, canal par canal : par exemple l'IA pour six langues et un interprète humain pour la septième. Les interprètes travaillent depuis n'importe où via une console web - sans installation, protégée par un code d'accès propre à l'événement.
Ce que vivent les participants
Les participants scannent un QR code, choisissent une langue et écoutent sur leur propre téléphone - avec des sous-titres en direct dans la même langue. Sans application, sans compte, sans casques à distribuer. Voir Un public sans casque pour le parcours complet du participant.

