Respuesta rápida: para anonimizar una transcripción, primero conviértela en texto con una herramienta precisa como VOCAP, después pásala por un modelo de IA con un prompt que sustituya nombres, empresas, teléfonos, emails y direcciones por marcadores consistentes ([PERSONA_1], [EMPRESA_1]), y termina con una revisión humana buscando identificadores indirectos (cargos únicos, lugares, fechas). Si conservas una tabla de correspondencias protegida, es seudonimización (el RGPD sigue aplicando); si la destruyes y nadie puede reidentificar, es anonimización y el texto sale del ámbito del RGPD.
Cada transcripción de reunión, entrevista o llamada es un pequeño fichero de datos personales: nombres, cargos, empresas, teléfonos que se dictan en voz alta, y a veces datos de salud o de opinión que ni recuerdas que se mencionaron. Mientras el texto duerme en una carpeta compartida, tú respondes de él ante el RGPD.
La buena noticia: anonimizar bien ha dejado de ser un trabajo artesanal. En esta guía verás qué exige exactamente el RGPD, la diferencia práctica entre anonimizar y seudonimizar, el flujo completo con IA, los prompts listos para copiar y los errores que dejan transcripciones «anónimas» perfectamente reidentificables.
Por qué las transcripciones son un riesgo RGPD
Una transcripción parece un documento de trabajo inocuo, pero según el artículo 4 del RGPD casi todo lo que contiene es dato personal:
- Identificadores directos. Nombres y apellidos de los asistentes, emails y teléfonos dictados en voz alta, empresas y cargos que identifican a una persona concreta.
- La propia voz. La grabación original es un dato biométrico en potencia; el par audio + transcripción identifica más que cada pieza por separado.
- Categorías especiales (artículo 9). En reuniones y entrevistas se cuelan datos de salud («estuve de baja por...»), afiliación sindical, ideología u orientación. Su tratamiento exige protección reforzada y, a menudo, consentimiento explícito.
- Identificadores indirectos. «La directora financiera de la sede de Valencia» identifica a una persona sin decir su nombre. El RGPD también los considera datos personales si permiten la reidentificación.
- Conservación sin plazo. El riesgo real del día a día: transcripciones con datos identificables acumuladas durante años en carpetas compartidas, fuera de todo plazo de conservación justificable.
El principio que lo ordena todo: minimización (artículo 5.1.c). Conserva los datos personales solo mientras los necesites para el propósito original. Cuando lo que te interesa es el contenido de la conversación y no el quién, la anonimización te permite quedarte el valor sin la carga de cumplimiento. Sobre la grabación previa, revisa si es legal grabar la reunión o llamada en tu caso.
Anonimizar vs seudonimizar: la diferencia que importa
Son términos que se confunden constantemente y tienen consecuencias legales opuestas:
| Técnica | Qué se hace | ¿Reversible? | ¿Aplica el RGPD? | Ideal para |
|---|---|---|---|---|
| Anonimización | Se eliminan o generalizan todos los identificadores, directos e indirectos, sin conservar forma de revertirlo | No (si está bien hecha) | No: deja de ser dato personal (considerando 26) | Publicar fragmentos, casos de estudio, datasets de formación, archivo a largo plazo |
| Seudonimización | Se sustituyen los identificadores por códigos y se guarda una tabla de correspondencias separada y protegida | Sí, con la tabla | Sí: sigue siendo dato personal, pero cuenta como medida de seguridad (artículo 32) | Investigación con seguimiento, análisis interno, entrevistas longitudinales |
| Redacción parcial | Se tachan solo algunos datos (nombres, teléfonos) dejando el resto intacto | Parcialmente | Sí: los identificadores indirectos siguen ahí | Compartir un fragmento puntual con un tercero; nunca como «anonimización» real |
La trampa habitual: quitar los nombres y llamarlo anonimización. Si por contexto (cargo, sede, proyecto, fechas) alguien puede deducir quién habla, el RGPD sigue considerando el texto dato personal. La prueba práctica: ¿podría un compañero de esa empresa identificar a los hablantes leyendo el texto limpio? Si sí, aún no has terminado.
Paso a paso: de la grabación al texto limpio
Paso 1 — Transcribe el audio con una herramienta de calidad
Convierte la grabación en texto con un motor preciso. No es un detalle menor para la anonimización: si el motor escribe «Jorge Sanchís» como «jorge san chís», la pasada automática de limpieza no lo reconocerá como nombre y lo dejará pasar. Herramientas como VOCAP devuelven un texto limpio y con puntuación sobre el que la detección de entidades funciona bien. El mismo principio aplica a entrevistas de investigación UX o sesiones de terapia y coaching, dos de los casos donde más se anonimiza.
Paso 2 — Haz inventario de los datos personales
Antes de limpiar, lista qué contiene el documento: ¿solo nombres y empresas, o también teléfonos y emails dictados? ¿Hay datos de salud, sindicales o de opinión (categorías especiales)? ¿Cuántos hablantes hay y cómo se referencian entre sí? Este inventario decide el nivel de limpieza necesario y si puedes usar una IA en la nube o conviene una primera pasada local.
Paso 3 — Sustituye identificadores con un prompt de IA
Pasa la transcripción por Claude o ChatGPT con el prompt de la siguiente sección. Las claves: marcadores consistentes (la misma persona siempre es [PERSONA_1] en todo el documento, para que la conversación siga siendo legible), cobertura completa (nombres, empresas, cargos, teléfonos, emails, direcciones, matrículas, IDs) y pedir la tabla de correspondencias aparte, nunca incrustada en el texto.
Paso 4 — Revisa los identificadores indirectos
La pasada humana es donde se decide si el resultado es anónimo de verdad. Busca lo que la IA no marca por defecto: cargos únicos («el único ingeniero de la planta»), proyectos con nombre propio, lugares y fechas señaladas, anécdotas reconocibles. Generaliza esos pasajes («la responsable del área» en lugar del cargo exacto, «una ciudad del norte» en lugar del municipio) hasta que la prueba del compañero-de-empresa deje de funcionar.
Paso 5 — Gestiona la tabla de correspondencias y borra los originales
Decide el destino de la tabla: si necesitas reidentificar (estudios longitudinales, seguimiento de clientes), guárdala cifrada, en ubicación separada y con acceso restringido — eso es seudonimización y el RGPD sigue aplicando. Si no la necesitas, destrúyela y habrás anonimizado. En ambos casos, borra el audio original y la transcripción sin limpiar cuando venza su plazo de conservación: mantener los tres archivos para siempre anula todo el trabajo.
¿El paso 1 es el que te falta?
Sube la grabación y recibe una transcripción limpia y precisa sobre la que anonimizar. Prueba VOCAP gratis: 30 minutos sin tarjeta.
Probar VOCAP GratisPrompts listos para copiar
Pega la transcripción y añade uno de estos prompts encima. Recuerda usar cuentas o APIs con compromiso de no entrenamiento para material sensible.
Anonimización completa con marcadores
Anonimiza esta transcripción para cumplir el RGPD. Sustituye cada
dato personal por un marcador entre corchetes, usando siempre el
mismo marcador para la misma entidad en todo el texto: personas
([PERSONA_1], [PERSONA_2]...), empresas ([EMPRESA_1]...), lugares
([LUGAR_1]...), y [TELEFONO], [EMAIL], [DIRECCION], [ID] para datos
de contacto. No alteres nada más del contenido ni resumas. Al final,
en un bloque separado titulado TABLA, lista cada marcador con el
valor original que sustituye. Transcripción: [pega aquí el texto]
Seudonimización legible para informes
Seudonimiza esta transcripción de entrevista para un informe de
investigación: renombra a los hablantes como "Participante A",
"Participante B", etc., de forma consistente, y sustituye empresas
y lugares por descripciones genéricas equivalentes ("una empresa
del sector logístico", "una ciudad mediana"). Mantén el tono y las
citas textuales. Devuelve el texto limpio y, aparte, la tabla de
correspondencias. Transcripción: [pega aquí el texto]
Auditoría de reidentificación
Actúa como auditor de protección de datos. Revisa esta transcripción
ya anonimizada y señala todo pasaje que aún permita reidentificar a
una persona por contexto: cargos únicos, combinaciones de fecha y
lugar, proyectos con nombre propio, anécdotas reconocibles o datos
de categorías especiales (salud, ideología, afiliación). Para cada
hallazgo, cita el fragmento y propón una reformulación más genérica.
Texto: [pega aquí la transcripción anonimizada]
Qué contar como dato personal: checklist rápida
Al revisar una transcripción, esto es lo que debe activar la alarma:
- Identificadores directos: nombres y apellidos, apodos, emails, teléfonos, direcciones postales, DNI/NIF, matrículas, usuarios de redes.
- Identificadores profesionales: empresa + cargo (sobre todo si el cargo es único), número de empleado, proyectos con nombre interno.
- Identificadores indirectos: combinaciones de lugar + fecha + rol («el ponente del viernes en Bilbao»), características físicas o biográficas distintivas.
- Categorías especiales (artículo 9): salud física o mental, datos genéticos o biométricos, vida u orientación sexual, ideología, religión, afiliación sindical. Si aparecen, sube el nivel de protección: pasada local primero y acceso mínimo.
- Datos de terceros ausentes: clientes, pacientes o compañeros mencionados que no estaban en la conversación también cuentan; son los que más se escapan.
Cómo gestionar tablas de correspondencia y plazos
La diferencia entre un flujo que cumple y uno que solo lo aparenta está en la gestión posterior:
- Separación física. La tabla de correspondencias nunca vive en el mismo documento, carpeta ni sistema de permisos que la transcripción limpia. Si ambas se comparten juntas, no has seudonimizado nada.
- Acceso mínimo. Solo quien necesite reidentificar accede a la tabla; cifrada y con registro de accesos si el material es sensible.
- Plazos escritos. Define cuánto conservas el audio original, la transcripción íntegra y la tabla (por ejemplo: audio 30 días, transcripción identificable hasta cerrar el proyecto, versión anonimizada indefinidamente) y cúmplelos con borrados programados.
- Documenta el proceso. Una nota de una página con qué se anonimiza, cómo, quién accede a la tabla y qué plazos aplican es tu evidencia de responsabilidad proactiva (artículo 5.2) si alguien pregunta.
- El resto de la cadena también cuenta: la herramienta de transcripción, el almacenamiento y la IA que uses forman parte del tratamiento. Nuestra guía de seguridad y privacidad en transcripción con IA cubre cómo evaluar cada eslabón.
Transcribe con la privacidad como base
VOCAP transcribe tus reuniones y entrevistas con precisión y elimina los archivos de audio tras procesarlos. Transcripción + resumen con IA, listos para tu flujo de anonimización. Desde 1€/hora.
Empezar Gratis con VOCAPErrores comunes que dejan transcripciones reidentificables
- Quitar solo los nombres. El error clásico. «La directora financiera de la sede de Valencia» identifica igual que el nombre. Sin la pasada de identificadores indirectos, no hay anonimización.
- Marcadores inconsistentes. Si Juan es [PERSONA_1] en la página 2 y [PERSONA_3] en la 7, el análisis posterior se rompe y los despistes se multiplican. Consistencia en todo el documento.
- Guardar la tabla junto al texto limpio. Una «anonimización» con la clave de descifrado en la misma carpeta compartida es solo una molestia para el lector, no una medida de protección.
- Olvidar el audio original. Anonimizar el texto y conservar la grabación identificable para siempre deja el dato personal intacto; el conjunto sigue dentro del RGPD.
- Enviar material sensible a la IA equivocada. Categorías especiales de datos en una cuenta gratuita de consumo, sin DPA ni compromiso de no entrenamiento, es crear un problema para resolver otro. Para lo muy sensible: primera pasada local y cuentas de empresa.
- Confiar al 100% en la automatización. Los modelos fallan con apodos, nombres mal transcritos y referencias cruzadas. La revisión humana final —o el prompt de auditoría de arriba— es la que firma el resultado.
Preguntas frecuentes
¿Cómo se anonimiza una transcripción con IA?
En tres pasos: transcribe el audio con una herramienta de calidad como VOCAP, pasa el texto por un modelo de IA con un prompt que sustituya nombres, empresas, teléfonos, emails y direcciones por marcadores como [PERSONA_1] (el mismo marcador para la misma entidad en todo el documento), y revisa manualmente el resultado buscando identificadores indirectos que la IA pueda haber pasado por alto. La revisión humana final no es opcional: eres tú quien responde del cumplimiento, no el modelo.
¿Qué diferencia hay entre anonimizar y seudonimizar según el RGPD?
La anonimización elimina de forma irreversible toda posibilidad de identificación; el texto deja de ser dato personal y sale del RGPD. La seudonimización sustituye los identificadores por códigos pero conserva una tabla protegida que permite revertirlo; sigue siendo dato personal y el RGPD aplica, aunque cuenta como medida de seguridad (artículo 32). Para análisis interno suele bastar seudonimizar; para publicar o compartir fuera, apunta a anonimización real.
¿Una transcripción de reunión contiene datos personales?
Casi siempre: nombres de asistentes, la voz grabada, cargos, empresas, teléfonos y emails dictados son datos personales según el artículo 4 del RGPD. Si aparecen datos de salud, ideología o afiliación, son categorías especiales (artículo 9) con protección reforzada. Por eso no deberían compartirse ni archivarse a largo plazo sin evaluar qué contienen.
¿Puedo usar ChatGPT o Claude para anonimizar transcripciones confidenciales?
Con matices: enviar el texto sin limpiar a la IA ya es un tratamiento de datos. Usa cuentas de empresa o APIs con compromiso de no entrenamiento y DPA, evita versiones gratuitas de consumo para material sensible, y para lo muy delicado haz una primera pasada local (búsqueda y sustitución de nombres, emails y teléfonos) usando la IA solo para la revisión fina.
¿Cuándo estoy obligado a anonimizar una transcripción?
El RGPD no obliga a anonimizar siempre, pero exige minimización y plazos de conservación limitados. En la práctica: anonimiza al publicar fragmentos, al compartir con terceros ajenos al propósito original, al usar el material para formación o investigación, y cuando quieras conservar el contenido más allá del plazo justificable con datos identificables.
¿Cómo mantengo la coherencia de los hablantes al anonimizar una entrevista?
Con seudónimos consistentes: la misma persona es siempre [PERSONA_1] o «Participante A» en todo el documento, para que la conversación siga siendo analizable. Pide a la IA la tabla de correspondencias aparte y guárdala separada y protegida si necesitas reversibilidad — o destrúyela si buscas anonimización real. Nunca en la misma carpeta que el texto limpio.