Oui, il est possible de transcrire des appels contenant des données de santé. La chaîne doit être déployée dans un périmètre HDS adapté aux activités réalisées, encadrée par un contrat et conforme au RGPD. L’appelant doit aussi recevoir les informations requises sur l’enregistrement et, le cas échéant, sur son interaction avec une IA. Guardis exécute le STT, le TTS et le LLM en France ; le client conserve son produit, ses finalités et ses responsabilités de responsable de traitement.
Vous éditez la solution vocale. Guardis porte les GPU, la certification et la responsabilité d’hébergeur.
Pourquoi vos appels peuvent être des données de santé
Un appel relève des données de santé dès que son contenu ou son contexte révèle la santé d’une personne identifiable. Motif de rendez-vous, pathologie ou posologie peuvent suffire. Audio, transcription, résumé et champs extraits portent alors l’information sensible. Les métadonnées le deviennent parfois par recoupement.
Notre dossier sur l’hébergement des données de santé : le cadre légal détaille l’articulation entre le Code de la santé publique, le RGPD et le secret médical. Pour qualifier votre propre chaîne de sous-traitance, vérifiez aussi qui est concerné par l’obligation HDS.
L’article L.1111-8 du Code de la santé publique encadre l’hébergement pour compte de tiers. L’article L.1115-1 sanctionne l’absence du certificat requis de trois ans d’emprisonnement et 45 000 euros d’amende. S’ajoutent le secret médical de l’article L.1110-4, une base de l’article 6, une exception de l’article 9 et les articles 28 et 32 du RGPD.
La certification de l’hébergeur ne rend pas le service entier conforme. Le responsable conserve finalité, minimisation, durée, information, droits et AIPD éventuelle. L’article R.1111-8-8 exclut étroitement une remise courte limitée à la saisie, mise en forme, matérialisation ou dématérialisation. Architecture et conservation déterminent son application.
Ce qui a changé en 2026
Depuis le 16 mai 2026, un certificat HDS v1.1 n’est plus valide. L’arrêté du 26 avril 2024, publié le 16 mai 2024, accordait 24 mois de transition. L’ANS confirme ce calendrier.
Vérifiez le certificat de votre hébergeur actuel
Demandez la version, la date de validité, l’organisme certificateur, les activités couvertes et les sous-traitants. Guardis publie ce que couvre réellement la certification HDS. Vérifiez aussi pourquoi ISO 27001 et HDS ne recouvrent pas les mêmes exigences.
Guardis déclare les certificats ISO/IEC 27001:2022 n° CT-ISMS-082025-0CU01876 et HDS v2.0 n° CT-HDS-082025-0CU01876, activités 2 à 6, délivrés par CertiTRUST, organisme accrédité par le COFRAC. L’activité 1, relative aux sites physiques, est hors de ce périmètre.
AI Act : informer l’appelant et encadrer l’audio synthétique
L’article 50 de l’AI Act s’applique depuis le 2 août 2026. Une personne qui interagit directement avec une IA doit en être informée, sauf évidence. Une transcription entre deux humains ne déclenche pas seule cette règle, sans supprimer l’information RGPD/CNIL. Le son synthétique doit être marqué dans un format lisible par machine. Le 2 décembre 2026 est seulement l’échéance transitoire de ce marquage pour certains systèmes déjà commercialisés.
L’inférence d’émotions au travail est interdite
Depuis le 2 février 2025, l’article 5(1)(f) interdit d’inférer les émotions de salariés à partir de données biométriques, hors raisons médicales ou de sécurité. Le scoring vocal d’un téléconseiller est visé s’il répond à cette définition ; l’analyse sémantique seule n’y entre pas automatiquement.
Selon les lignes directrices de la Commission, l’émotion d’un client n’est pas interdite par ce seul article. RGPD et transparence subsistent ; le système peut relever du haut risque, reporté au 2 décembre 2027. Une analyse juridique reste nécessaire.
Les plafonds atteignent 15 millions d’euros ou 3 % pour l’article 50, et 35 millions ou 7 % pour l’article 5 ; le plus faible s’applique aux PME.
Notre page sur la conformité IA : ISO 42001, RGPD et NIS2 aide à organiser les contrôles. ISO 42001 et NIS2 sont ici des cadres d’alignement, pas des certifications revendiquées par Guardis.
Une chaîne STT, LLM et TTS entièrement maîtrisée
Une IA vocale souveraine couvre le flux téléphonique, la transcription, le contexte LLM, la synthèse et les traces dans un même périmètre contractuel. Cette chaîne de transcription d’appels HDS se compose ainsi :
Appel SIP/RTP (G.711 ou G.729, souvent 8 kHz)
→ VAD et segmentation
→ STT : Whisper ou modèle streaming
→ diarisation et alignement mot à mot
→ LLM local : résumé, motif, extraction, agent assist
→ TTS : Kokoro-82M
→ retour RTP
Stockage, journaux et traitements restent dans le périmètre défini au contrat.
Le speech to text HDS et la synthèse vocale HDS décrivent ici des traitements opérés dans ce périmètre, jamais une certification du modèle.
Guardis publie 256 Go de VRAM agrégée par nœud avec interconnexion NVLink ; la configuration réellement réservée est confirmée au dimensionnement.
Modèles et composants évalués
| Brique | Licence ou régime | Usage et limite à mesurer |
|---|---|---|
| Whisper large-v3 / turbo | MIT | Multilingues, fenêtres de 30 s ; turbo réduit le décodeur de 32 à 4 couches. WER à mesurer. |
| faster-whisper / whisper.cpp | MIT | Runtimes optimisés ; gain dépendant du matériel, de la quantification et de la charge. |
| WhisperX + pyannote | Code BSD-2-Clause ; modèles séparés | Alignement mot à mot et diarisation ; chaque modèle et licence doivent être audités. |
Kyutai stt-1b-en_fr | CC BY 4.0 | Français/anglais, streaming natif, VAD sémantique, délai nominal de 0,5 s. |
| Voxtral Realtime / Parakeet v3 | Apache 2.0 / CC BY 4.0 | Alternatives multilingues couvrant le français, à comparer sur les appels réels. |
| Kokoro-82M | Apache 2.0 | TTS de 82 M de paramètres, environ 327 Mo, 54 voix et 8 groupes de langues. Français surtout couvert par ff_siwis. |
Les variantes Whisper communautaires fine-tunées en français sont comparées seulement après audit de leur artefact, de leur licence et de leur corpus.
Kokoro associe StyleTTS 2 et ISTFTNet. Sa qualité française, son temps au premier son et son débit sont validés pendant le POC, sur le matériel de production. Un autre moteur peut être substitué après audit. Le Piper maintenu est sous GPL-3.0 et chaque voix possède sa licence. XTTS-v2 n’est pas proposé commercialement sans licence distincte : ses poids relèvent de la Coqui Public Model License, limitée aux usages non commerciaux.
L’expression « LLM auto-hébergé HDS » qualifie le service d’hébergement, pas le modèle. Les LLM open-weight, dont certaines versions de Qwen, sont servis via vLLM ou llama.cpp ; la licence se contrôle par checkpoint. Pour les sources métier, notre architecture de RAG sécurisé garde vectorisation et génération dans l’environnement convenu. Ce socle permet d’héberger des modèles d’IA dans un cloud souverain. n8n et Docker sur cloud souverain HDS orchestrent les traitements sans SaaS imposé.
Six points qui déterminent la qualité réelle
- Bande étroite. G.711 et G.729 sont souvent à 8 kHz ; l’entrée Whisper à 16 kHz ne recrée pas les fréquences perdues. Le WER doit être testé sur le standard médical.
- Streaming. Whisper traite des fenêtres. VAD et contexte partiel simulent le temps réel ; Kyutai ou Voxtral gèrent le barge-in natif.
- Latence. Réseau, VAD, STT, premier token LLM et premier son TTS s’additionnent. La cible de 800 ms à 1,2 s devient SLA après mesure médiane et P95.
- Vocabulaire médical. Molécules, posologies, acronymes et noms propres exigent lexique, biaisage ou fine-tuning, puis test par spécialité.
- Whisper ≠ API OpenAI. Code et poids MIT permettent un Whisper hébergé en France, sans l’API d’OpenAI.
- Audio ≠ texte. Enregistrement, transcription, diarisation et résumé ont parfois des finalités, accès et durées distincts.
Selon le projet, l’intégration couvre SIP/RTP, SIPREC, MRCPv2, WebRTC, webhooks, Asterisk et FreeSWITCH. Une façade peut exposer /v1/audio/transcriptions et /v1/chat/completions. Pour le CRM, le DPI ou le CCaaS, le groupe peut assurer une intégration applicative sur mesure.
Ce que Guardis fournit exactement
Guardis fournit le socle d’inférence, d’hébergement et d’exploitation ; l’éditeur conserve son applicatif, son expérience utilisateur, sa marque et ses décisions métier.
| Inclus dans le périmètre à contractualiser | Reste à la charge du client ou se partage |
|---|---|
| GPU dédiés ou mutualisés ; STT, TTS et LLM auto-hébergés ; API compatible | Produit vocal, UX, prompts et règles métier |
| Cloisonnement, chiffrement, contrôle des accès et journalisation | Finalités, base légale, information, droits, registre et AIPD éventuelle |
| Stockage, conservation, sauvegarde, supervision et continuité selon contrat | Durées métier, validation humaine, recette et continuité applicative |
| DPA, annexe HDS, plan d’assurance sécurité et matrice des rôles | Mentions d’appel, opposition et relations avec les donneurs d’ordre |
| Réversibilité documentée | Traitement des erreurs et plan de sortie produit |
Les journaux peuvent alimenter une supervision SOC 24/7. La conservation contractuelle peut s’appuyer sur une sauvegarde immuable HDS. La réversibilité est articulée avec un plan de reprise d’activité.
Guardis couvre les activités HDS 2 à 6, pas l’activité 1. L’éditeur qui administre des ressources pour compte de tiers peut exercer l’activité 5. La matrice de responsabilités doit le trancher avec RSSI, DPO et conseil.
Guardis ne concurrence pas ses clients : éditeurs de voicebots, de speech analytics et de centres de contact intègrent le socle sous leur produit.
Souveraineté physique de bout en bout
Le flux audio peut rejoindre les GPU du périmètre convenu sans Internet public, par fibre dédiée ou APN privé. Plateau, réseau, hébergement et inférence forment alors une même chaîne physique et juridique.
Le groupe MUONA propose un APN privé et une connectivité dédiée M2M pour les sites fixes ou mobiles. Guardis expose notre approche de la souveraineté et les limites de chaque option.
Le projet peut retenir un accès Internet chiffré, un lien privé vers les datacenters français ou un environnement isolé, selon l’étude de faisabilité. Les flux d’administration, de secours et de mise à jour restent décrits : « sans Internet public » ne signifie pas « sans réseau ».
Pour qui ?
Cette offre vise les organisations qui possèdent déjà un produit ou un processus vocal et cherchent un socle d’IA opéré dans un environnement HDS.
Éditeurs de téléphonie et de CCaaS
Vous ajoutez transcription, résumé, agent assist ou speech analytics. L’hébergement HDS pour éditeur et l’API répondent au besoin santé sans remplacer votre produit. Vous restez l’éditeur de l’agent vocal conforme à votre cas d’usage.
Télésecrétariats médicaux et centres d’appels santé
Rendez-vous, permanence des soins et préadmission véhiculent le secret médical. Le socle conserve l’interface opérateur et déplace le traitement vers un cloud souverain pour le secteur santé.
Éditeurs de logiciels de santé
LGO, DPI, télémédecine et télésurveillance intègrent dictée ou compte rendu. La page cabinets médicaux et laboratoires précise les contraintes associées.
Mutuelles, assurances santé et prévoyance
Le motif d’une prestation peut révéler la santé. Les équipes assurances et mutuelles évaluent transcription et résumé sans API publique par défaut.
Établissements de santé
Hôpitaux, cliniques, GHT, EHPAD et laboratoires raccordent standard, régulation ou dictée. Le POC vérifie codecs, spécialités, charge et continuité.
Industrie pharmaceutique et CRO
Pharmacovigilance, information médicale et essais cliniques exigent confidentialité, traçabilité et validation métier des champs extraits.
La même infrastructure sert banque, assurance IARD, justice ou défense. Le secret professionnel remplace alors le secret médical ; HDS n’est pas automatiquement requis.
Comparer les dispositifs, pas les promesses
Une API vocale, un hébergeur HDS généraliste et Guardis ne couvrent pas la même chaîne. Comparez service contracté, juridiction et périmètre.
| Critère | API vocale extra-européenne (OpenAI, Deepgram, AssemblyAI, ElevenLabs) | Hébergeur HDS généraliste | Guardis |
|---|---|---|---|
| HDS et périmètre | Variable par service, région et contrat | Certificat à contrôler par activité | HDS v2.0 déclaré, activités 2 à 6 ; activité 1 exclue |
| Loi extraterritoriale | Entité, sous-traitants et mesures à analyser | Dépend des fournisseurs et de l’architecture | MUONA SAS française ; aucun hyperscaler américain revendu selon Guardis |
| Localisation de l’inférence | Région et flux annexes à vérifier | France ou Europe selon l’offre | Modèles et données exécutés en France dans le périmètre convenu |
| Modèles auto-hébergés | Généralement non pour une API managée | Possible, à intégrer et exploiter | Whisper, Kokoro et LLM opérés |
| Lien privé | Options variables selon le fournisseur | Interconnexion possible selon l’offre | Fibre dédiée ou APN privé étudié de bout en bout |
| Réversibilité | Formats, quotas et export à négocier | Selon le contrat | Modèles open-weight et plan de sortie à contractualiser |
| Interlocuteur unique | API et hébergement parfois séparés | Intégration souvent séparée | Réseau, hébergement et inférence réunis dans le groupe |
Pour instruire le risque de juridiction, consultez le cadre juridique du cloud souverain. Annexez les numéros, dates et limites de nos certifications et leur périmètre au dossier fournisseur.
Démarrer par un POC de 15 jours
Le POC mesure WER, latence, qualité française et coût sur les appels réels avant tout engagement.
- Sélection de dix appels représentatifs, sur une base légale documentée et avec minimisation possible.
- WER par codec, spécialité et erreur critique ; comparaison de Whisper et d’un moteur streaming si utile.
- Latence de chaque étage, du RTP entrant au premier son TTS.
- Écoute de
ff_siwis, essai d’un autre moteur et audit des licences. - Validation de SIPREC, MRCPv2, API, sécurité, volumétrie, réversibilité et chiffrage.
Tester votre WER sur 10 appels réels : POC 15 jours.
Avant le cadrage, testez votre conformité en 5 minutes puis demandez la matrice des responsabilités applicable à votre projet.
Questions fréquentes
Peut-on utiliser Whisper avec des données de santé ?
Oui, si le traitement respecte le cadre applicable. Le code et les poids de Whisper sont sous licence MIT et peuvent s’exécuter en France sans transmettre l’audio à OpenAI. Le modèle ne confère aucune conformité : hébergement, accès, contrat, finalités, durées et droits restent à encadrer, avec un périmètre HDS adapté lorsque l’article L.1111-8 s’applique.
L’API d’OpenAI est-elle conforme HDS ?
Pas par principe. Une certification HDS porte sur un prestataire, des activités, un périmètre et un service déterminés. Demandez un certificat valide couvrant précisément la région, l’API et sa sous-traitance. Sans cette preuve, ne présentez pas l’API comme HDS. Whisper auto-hébergé est distinct de l’API hébergée d’OpenAI.
Faut-il être certifié HDS pour transcrire des appels médicaux ?
Le prestataire qui héberge pour compte de tiers les données de santé visées par l’article L.1111-8 doit être certifié pour ses activités. L’exception de remise très courte limitée à la saisie ou à la mise en forme est étroite. Le donneur d’ordre reste responsable du RGPD, du secret médical, du contrat de sous-traitance et de ses propres opérations.
Qui doit être certifié : l’éditeur de la solution ou l’hébergeur ?
L’entité qui réalise une activité d’hébergement HDS pour compte de tiers doit être couverte. Un éditeur qui délègue toutes les activités peut s’appuyer sur son hébergeur. S’il administre le système contenant les données, il peut exercer l’activité 5 et devoir être couvert. L’architecture et le contrat doivent être validés avec RSSI, DPO et conseil.
Une transcription d’appel est-elle une donnée de santé ?
Oui lorsqu’elle révèle, directement ou par recoupement, la santé d’une personne identifiable : motif de consultation, pathologie, traitement, spécialité ou résultat. Une transcription sans contenu médical n’est pas automatiquement une donnée de santé. Audio, texte, métadonnées et champs extraits doivent être qualifiés séparément selon leur contenu et leur contexte.
Combien de temps peut-on conserver un enregistrement d’appel médical ?
Il n’existe pas de durée unique. La CNIL recommande jusqu’à six mois pour certains enregistrements de formation ou de qualité. Une conservation probatoire peut suivre le délai de prescription pertinent (cinq ans dans certains contrats), seulement si l’audio est nécessaire. Enregistrement et transcription peuvent avoir des durées distinctes, justifiées par finalité et validées par le DPO.
Dois-je prévenir mon interlocuteur qu’il parle à une IA ?
Oui si la personne interagit directement avec l’IA, sauf si cela est évident. Une transcription en arrière-plan entre deux humains ne déclenche pas seule cette obligation. Les informations RGPD et CNIL sur l’enregistrement ou la transcription subsistent : responsable, finalité, base légale, destinataires, durée et droits. Le message doit rester clair et accessible.
Puis-je analyser les émotions de mes téléconseillers ?
En principe non si le système infère leurs émotions à partir de données biométriques au travail : l’article 5 de l’AI Act l’interdit, hors raisons médicales ou de sécurité. Une analyse sémantique n’entre pas automatiquement dans cette définition. L’émotion d’un client relève d’un autre régime. Faites qualifier chaque fonction avant déploiement.
Quelle est la différence entre le référentiel HDS v1.1 et v2.0 ?
HDS v2.0 s’appuie notamment sur ISO/IEC 27001:2022 et renforce les exigences de souveraineté, de transfert et de sous-traitance. La transition s’est achevée le 16 mai 2026 : les certificats v1.1 ne sont plus valides. Contrôlez aussi les activités. Guardis déclare les activités 2 à 6 ; l’activité 1 reste hors certificat.
Quel niveau de latence peut-on atteindre sur un agent vocal ?
La latence dépend du réseau, du VAD, du STT, du premier token LLM, du TTS, du codec et de la charge. Une cible projet de 800 ms à 1,2 s guide un dialogue interactif, sans constituer une promesse. Guardis mesure médiane, P95 et chaque étage pendant le POC avant tout engagement.
Un socle vocal certifié, sans conflit de canal
Guardis, marque de MUONA SAS, déclare les certifications ISO/IEC 27001:2022 n° CT-ISMS-082025-0CU01876 et HDS v2.0 activités 2 à 6 n° CT-HDS-082025-0CU01876, délivrées par CertiTRUST. L’activité 1 reste hors de ce périmètre.
Demander un audit IA souveraine gratuit. Tester votre WER sur 10 appels réels : POC 15 jours.