Validación del sistema de categorías de respuesta verbal del psicoterapeuta mediante modelos de IA
Esta tesis evalúa si la inteligencia artificial puede automatizar, con una fiabilidad equivalente a la humana, la codificación de las intervenciones verbales del psicoterapeuta — desde una epistemología que entiende la terapia como construcción conjunta de significado.
Se usará el sistema de categorías de Hill (HSS; Hill, 2020), panteórico, con doce categorías en tres dominios. Un conjunto pluralista de series de seis sesiones grabadas será codificado en paralelo por jueces humanos y por modelos de IA; el grado de acuerdo entre ambos determinará la validez y viabilidad de la automatización. De forma exploratoria, se analizará también cómo evolucionan esas categorías a lo largo de cada serie, distinguiendo lo que responde a la orientación teórica de lo que responde al terapeuta concreto.
La psicoterapia funciona, y las distintas orientaciones rinden de forma similar entre sí (Wampold & Imel, 2015). Eso desplaza el interés hacia el efecto del terapeuta: profesionales comparables logran resultados distintos (Wampold & Brown, 2005) — sin que sepamos aún en qué consiste esa diferencia.
Estudiarlo exige mirar qué hace el terapeuta en sesión, de ahí la codificación de su conducta verbal (Orlinsky et al., 2004). Este estudio usa el sistema de Hill por su continuidad de cuatro décadas y su vocación panteórica — pero codificarlo a mano es costoso, y ningún trabajo reciente de automatización con LLM lo ha validado todavía sobre este instrumento ni con una arquitectura íntegramente local.
No existe una validación del sistema de Hill mediante modelos de IA.
No existe una arquitectura íntegramente local que garantice máxima privacidad clínica.
La adecuación del sistema solo se probó en sesiones únicas, no en series completas con la versión actual.
Validación metodológica de la codificación automatizada de respuestas verbales del terapeuta en series completas, con un componente exploratorio: contrastar la adecuación del sistema entre orientaciones y describir sus fuentes de variación.
Evaluar la viabilidad y validez de codificar, con modelos de IA ejecutados localmente, las respuestas del terapeuta según el sistema de Hill — tomando la codificación humana como referencia.
Dos jueces independientes fijan el nivel de detalle categorial fiable.
Pipeline alineado con RGPD e HIPAA, sin servicios externos.
Varias familias de LLM locales, bajo distintas configuraciones.
Humano-IA, entre modelos, y estabilidad ante variaciones del procedimiento.
Capacidad de clasificar sin recurrir en exceso a la categoría residual.
Patrones congruentes con la orientación vs. atribuibles al terapeuta.
Requisitos de hardware de cada configuración local.
¿Cuánto coinciden dos jueces humanos, y con qué nivel de detalle?
¿Se puede desidentificar el corpus sin servicios externos, con riesgo residual aceptable?
¿Cuánto reproducen los modelos locales la codificación humana?
¿Describe el sistema de Hill a terapeutas de orientaciones distintas sin abusar de categoría residual?
¿La distribución de dominios por serie encaja con la orientación declarada — y dónde no?
¿Qué configuración equilibra mejor acuerdo, robustez y eficiencia en local?
El estudio parte del marco de Luis Botella (Botella & Gallifa, 1995; Botella & Herrero, 2000; Botella, 2001; Botella et al., 2004): el significado no se descubre, se construye activamente y en el lenguaje compartido con otros. La psicoterapia es un diálogo colaborativo y no un tratamiento administrado por un experto a un receptor pasivo, sino una conversación en la que el terapeuta es coinvestigador de los significados.
«El terapeuta como tejedor de historias.»Botella, 2001
Es una metateoría (Feixas, 1991), no una escuela más: pone en diálogo tradiciones que rara vez se hablan entre sí, sin declarar a ninguna la única verdad.
El efecto del terapeuta describe la variabilidad entre profesionales comparables, pero no explica en qué consiste (Wampold & Owen, 2021). La investigación de proceso desplaza la pregunta hacia qué ocurre realmente en sesión — y codificar la conducta verbal es la vía empírica más directa (Russell & Stiles, 1979).
Un matiz importante: la orientación declarada no absorbe esa variación. Terapeutas de la misma escuela difieren entre sí de forma sistemática (Wampold & Brown, 2005) — este estudio mantiene ambas explicaciones abiertas (4.3, 5.1).
El Helping Skills System (HSS; Hill, 2020) organiza doce categorías, mutuamente excluyentes, en tres dominios — construidos deliberadamente a partir de tres orientaciones clínicas mayores. Hill describe el recorrido como conducir al cliente «hacia dentro y hacia abajo» para comprenderse, y luego «hacia fuera y hacia arriba» para actuar.
Adaptado de Hill, 2020, Exhibit 2.1.
«Panteórico» significa inclusivo — no predice parecido entre terapeutas. Hill, Thames y Rardin (1979) lo confirmaron codificando a Rogers, Perls y Ellis con una misma cliente: perfiles radicalmente distintos, pero todos bien descritos por el sistema.
Hill, Thames y Rardin (1979), sobre Three Approaches to Psychotherapy (Shostrum, 1966).
¿Clasifican las doce categorías toda la conducta verbal, con pocos residuales, en cualquier orientación? Esto no dice si los terapeutas se parecen — dice que el instrumento sirve para compararlos.
Orientación declarada vs. efecto del terapeuta: dos explicaciones plausibles que este estudio no puede separar de forma concluyente (5.1).
Tras los primeros clasificadores entrenados a medida (Carcone et al., 2019: κ = .64), los LLM preentrenados marcan un cambio de paradigma. Tres estudios recientes son los precedentes más cercanos — ninguno usa el sistema de Hill ni una arquitectura 100% local.
| Estudio | Objeto | Arquitectura | Acuerdo | Este estudio |
|---|---|---|---|---|
| Hammerfald et al. (2025) | 8 microcounseling skills, GPT-4.1 ajustado | API comercial | κ=.69 vs. .54–.59 humano | Sistema de Hill sobre conducta del terapeuta, LLM de pesos abiertos 100% local. Meta: κ>.60 humano-humano, acuerdo modelo≈humano. |
| Baldo et al. (2026) | Ontología propia, 10 movimientos | LLM juez + voto mayoritario | α≈.63, iguala humano | |
| Yim et al. (2026) | Experiencing Scale (cliente) | Desidentificación local + nube | No reportado |
Los tres coinciden en un patrón: el acuerdo humano-humano rara vez supera lo moderado-sustancial, y el LLM se degrada en categorías ambiguas — con independencia de la taxonomía. Baldo et al. (2026) advierten, además, que taxonomías como la de Hill se diseñaron para formación humana, no para sistemas automatizados; el diseño del apartado 5 intenta tenerlo en cuenta.
Diseño observacional sobre material de archivo, sin intervención sobre pacientes reales. Combina dos lógicas: validación metodológica (¿reproduce la IA al codificador humano?) y un diseño de casos múltiples exploratorio (¿cómo varían los dominios por serie?).
Cada serie confunde terapeuta, cliente y orientación entre sí — ninguna diferencia entre series puede atribuirse de forma inequívoca a una sola de esas variables. Por eso todo el análisis de distribución se trata como evidencia exploratoria, nunca confirmatoria.
El corpus de partida comprende ~24 series de seis sesiones (~144 sesiones en total), procedentes de la colección APA Psychotherapy in Six Sessions (Alexander Street). El terapeuta y el cliente se mantienen constantes dentro de cada serie y, previsiblemente, cada serie representa una orientación clínica distinta. Baker et al. (2022) y Diaz et al. (2023) ya utilizaron este corpus para codificar el afecto, pero no la conducta verbal del terapeuta, lo que respalda su idoneidad para el presente estudio sin solapamiento con la variable aquí analizada.
Continuidad directa con el precedente de 1979 que puso a prueba el sistema por primera vez.
Nivel primario: las doce categorías del HSS. Las subcategorías se usan solo si la fiabilidad humana lo permite. Unidad de análisis: la oración gramatical del terapeuta — más exigente que el turno de habla completo usado en otros estudios automatizados (p. ej. Baldo et al., 2026), pero comparable con la tradición del instrumento.
Toca cada fase para ver el detalle. Las fases 2 y 3 requieren solapamiento: la fiabilidad humana condiciona el nivel de detalle automatizado.
Acuerdo entre jueces al menos moderado-sustancial (κ>.60), congruente con Hill et al. (1979): κ .68–.73.
Al menos un modelo alcanzará, en categorías principales, un acuerdo comparable al humano-humano.
Más variabilidad en subcategorías, y en reformulación, reflejo, interpretación y confrontación.
Pocos residuales y fiabilidad comparable en las series, sin importar la orientación.
Más insight en psicodinámicas, más acción en cognitivo-conductuales, más exploración en humanistas.
Algunas series invertirán lo esperado por su escuela — candidatas al efecto del terapeuta, sin atribución concluyente.
Material con licencia académica. Tres modalidades de datos, con un único sentido de flujo permitido:
Trazabilidad completa de cada resultado; las transcripciones originales se eliminan al finalizar la tesis.
La codificación humana es siempre el criterio de referencia, nunca al revés.
Los jueces humanos, no el modelo, resuelven los casos ambiguos.
Trazabilidad completa: corpus, pipeline, modelo, prompt, parámetros.
El diseño muestral no separa el efecto de la orientación del efecto del terapeuta o del cliente concretos — toda la evidencia sobre distribución de dominios es exploratoria, nunca confirmatoria.
Las fases 3 y 4 requieren solapamiento: la fiabilidad humana condiciona el nivel de detalle automatizado. Cronograma orientativo, sujeto al calendario de matriculación.
Fase 0 en curso. Las barras heredan el color de codificación humana (F3) y automatizada (F4) del apartado 5.4.
El detalle completo, con formato APA, también está en el documento del plan de investigación.
Anderson, H., y Goolishian, H. (1988). Human systems as linguistic systems. Family Process, 27(4), 371-393.
Baker, A. Z., Peluso, P. R., Freund, R., Diaz, P., y Ghaness, A. (2022). Using dynamical systems mathematical modeling to examine emotional expression. Psychotherapy Research, 32(2), 223-237.
Bakhtin, M. (1986). The problem of speech genres. En Speech genres and other late essays (pp. 60-102). University of Texas Press.
Baldo et al. (2026). Move by Move: Measuring and Steering How LLMs Conduct Psychotherapy. arXiv:2608.21325.
Berzonsky, M. D. (1992, junio). Self-construction and hard-core epistemic assumptions [Trabajo presentado]. Sixth Conference EAPP, Groningen.
Botella, L. (2001). Diálogo, relaciones y cambio. FPCEE Blanquerna, Universidad Ramón Llull.
Botella, L. (2020). La construcción del cambio terapéutico. Desclée De Brouwer.
Botella, L. (2025). Therapy Process Navigator (TPN) [Manuscrito en preparación].
Botella, L., Herrero, O., Pacheco, M., y Corbella, S. (2004). Relational constructivism. En Working with narrative in psychotherapy (pp. 119-136). FPCEE Blanquerna.
Botella, L., y Gallifa, J. (1995). A constructivist approach to personal epistemic assumptions. Journal of Constructivist Psychology, 8(1), 1-18.
Botella, L., y Herrero, O. (2000). A relational constructivist approach to narrative therapy. European Journal of Psychotherapy, Counselling and Health, 3(3), 407-418.
Botella, L., y Saúl, L. Á. (2026). Inteligencia artificial generativa en psicoterapia constructivista. Revista de Psicoterapia, 37(134), 46-54.
Can, D., Marín, R. A., Georgiou, P. G., Imel, Z. E., Atkins, D. C., y Narayanan, S. S. (2016). 'It sounds like...'. Journal of Counseling Psychology, 63(3), 343.
Carcone, A. I., Hasan, M., Alexander, G. L., et al. (2019). Developing machine learning models for behavioral coding. Journal of Pediatric Psychology, 44(3), 289-299.
Carkhuff, R. R. (1969). Helping and human relations (Vols. 1-2). Holt, Rinehart & Winston.
Carkhuff, R. R., y Anthony, W. A. (1979). The skills of helping. Human Resource Development Press.
Diaz, P., Peluso, P. R., Freund, R., Baker, A. Z., y Peña, G. (2023). Understanding the role of emotion and expertise in psychotherapy. Frontiers in Psychiatry, 14, 980739.
Ecker, B., y Hulley, L. (2000). Symptom coherence in depth-oriented brief therapy. En Constructions of disorder (pp. 63-89). APA.
Falkenström, F., Finkel, S., Sandell, R., Rubel, J. A., y Holmqvist, R. (2017). Dynamic models of individual change. Journal of Consulting and Clinical Psychology, 85(6), 537.
Feixas, G. (1991). Del individuo al sistema. Revista de Psicoterapia, 2, 91-120.
Gendlin, E. T. (1962). Experiencing and the creation of meaning.
Gergen, K. J. (1994). Realities and relationships. Harvard University Press.
Gibson, J., Can, D., Xiao, B., et al. (2016). A deep learning approach to modeling empathy in addiction counseling. Commitment, 111, 21.
Goodman, G., y Dooley, D. A. (1976). A framework for help-intended communication. Psychotherapy: Theory, Research, and Practice, 13(2), 106-117.
Hammerfald, K., Schmidt, F., Vlassov, V., Jahren, H. H., y Solbakken, O. A. (2025). Leveraging LLMs to identify microcounseling skills. Psychotherapy Research, 36(6), 1058-1076.
Hill, C. E. (1978). Development of a counselor verbal response category system. Journal of Counseling Psychology, 25(5), 461-468.
Hill, C. E. (2020). Helping Skills: Facilitating Exploration, Insight, and Action (5.ª ed.). APA.
Hill, C. E., y O'Brien, K. M. (1999). Helping skills. APA.
Hill, C. E., Thames, T. B., y Rardin, D. K. (1979). Comparison of Rogers, Perls, and Ellis on the Hill Counselor Verbal Response Category System. Journal of Counseling Psychology, 26(3), 198-203.
Imel, Z. E., Steyvers, M., y Atkins, D. C. (2015). Computational psychotherapy research. Psychotherapy, 52(1), 19.
Kelly, G. A. (1955/1991). The psychology of personal constructs. Routledge.
Luborsky, L., Singer, B., y Luborsky, L. (1975). Comparative studies of psychotherapies. Archives of General Psychiatry, 32(8), 995-1008.
Mahoney, M. J. (1991). Human change processes. Basic Books.
Mahrer, A. R. (1983). Taxonomy of procedures and operations in psychotherapy.
Mitchell, S. A. (1988). Relational concepts in psychoanalysis. Harvard University Press.
Mook, B. (1992). Intersubjetividad y estructura narrativa en la terapia familiar. Revista de Psicoterapia, 10-11, 13-22.
Neimeyer, R. A. (2008). Therapy begins with who we are, and extends to what we do.
Neimeyer, R. A., Herrero, O., y Botella, L. (2006). Self-narratives and interpersonal accounts of experience. En Working with narrative in psychotherapy. FPCEE Blanquerna.
Orlinsky, D. E., Rønnestad, M. H., y Willutzki, U. (2004). Fifty years of psychotherapy process-outcome research. En Bergin and Garfield's handbook (5.ª ed., pp. 307-389). Wiley.
Porter, E. H. (1943). The development and evaluation of a measure of counseling interview procedures. Educational and Psychological Measurement.
Raskin, J. D., y Lewandowski, A. M. (2000). The construction of disorder as human enterprise. En Constructions of disorder (pp. 15-40). APA.
Reglamento (UE) 2016/679 (RGPD), arts. 5, 9 y 25.
Rogers, C. R. (1957). The necessary and sufficient conditions of therapeutic personality change. Journal of Consulting Psychology, 21(2), 95-103.
Russell, R. L., y Stiles, W. B. (1979). Categories for classifying language in psychotherapy. Psychological Bulletin, 86(2), 404-419.
Safran, J. D., y Segal, Z. V. (1990). Interpersonal process in cognitive therapy. Basic Books.
Shostrum, E. L. (Productor). (1966). Three approaches to psychotherapy [Película]. Psychological Films.
Smith, M. L., y Glass, G. V. (1977). Meta-analysis of psychotherapy outcome studies. American Psychologist, 32(9), 752-760.
Stiles, W. B. (1979). Verbal response modes and psychotherapeutic technique. Psychiatry, 42(3), 201-215.
U.S. Department of Health and Human Services. (s.f.). De-identification guidance, HIPAA Privacy Rule (45 C.F.R. § 164.514). HHS.gov.
Wampold, B. E. (2001). The great psychotherapy debate. Lawrence Erlbaum Associates.
Wampold, B. E. (2015). How important are the common factors in psychotherapy? World Psychiatry, 14(3), 270-277.
Wampold, B. E., y Brown, G. S. (2005). Estimating variability in outcomes attributable to therapists. Journal of Consulting and Clinical Psychology, 73(5), 914-923.
Wampold, B. E., y Imel, Z. E. (2015). The great psychotherapy debate (2.ª ed.). Routledge.
Wampold, B. E., y Owen, J. (2021). Therapist effects. En Bergin and Garfield's handbook (pp. 301-330). Wiley.
Wittgenstein, L. (1953). Philosophical investigations. Macmillan.
Yim, B., Muran, J. C., Ren, Q., y Gorman, B. (2026). Exploring the application of LLMs in coding the experiencing scale (EXP). Cogent Mental Health, 5(1), 2664163.