gonzalo moreno Hablemos

SENIOR QA AUTOMATION ENGINEER

Software que avanza.
Calidad que lo acompaña.

Soy Gonzalo. Construyo frameworks de testing desde cero y herramientas de IA para equipos que necesitan confiar en su software.

10+ años en QA · QA Architect & Lead · Madrid

EXPERIENCIA EN EQUIPOS DE

Devo DIA MásMóvil Bankinter BBVA Prosegur VASS MTP
01 / ARQUITECTURA

De cero a un
framework completo.

Web, APIs, mobile y CI/CD. Experiencia como QA Architect y QA Lead en VASS.

Ver trayectoria
02 / AI QUALITY

La IA también
necesita pruebas.

Evaluación de LLMs, sistemas RAG, regresión de prompts y seguridad.

Explorar AI Testing Lab
03 / CONOCIMIENTO

Lo que aprendo,
lo comparto.

Autor del Manual de QA para Sistemas de IA. 193 páginas de referencia práctica.

Conocer el manual

01 — TRAYECTORIA

Experiencia.
Con perspectiva.

De entender el negocio a diseñar la estrategia de calidad. Una trayectoria en banca, telecomunicaciones, retail y ciberseguridad.

2014 → HOY

Automatización.
Arquitectura.
Inteligencia artificial.

2025 — hoy MTP Actual Senior QA Automation Engineer Automatización, datos e IA aplicada al trabajo diario de QA.

Cliente: DIA Group · Retail · Sep 2025 – Actualidad

  • Tests automatizados de frontend y backend con Playwright y Karate DSL . Trabajo en optimizar el tiempo de ejecución de regresiones con paralelización, optimización de locators y estrategias de ejecución selectiva.
  • Construyendo agentes y skills de IA para el proyecto de automatización Playwright y para tareas de QA en general; también herramientas internas para generación de datos de test.
  • Miembro del AI Working Group de la empresa — aporto soluciones y comparto conocimiento sobre uso de IA aplicada a QA.
  • Testing data-driven integrado con Google Cloud (BigQuery + Pub/Sub) para validación de lógica de negocio y flujos de eventos asíncronos.
Playwright Karate DSL Generative AI BigQuery Pub/Sub
2022 — 2025 Devo Senior QA Automation Engineer Herramientas con LLMs dentro del ciclo de calidad.

Ciberseguridad SaaS · Sep 2022 – Ago 2025

Planificación e implementación de tests E2E y de integración con Cucumber + REST Assured + Java. Construí herramientas QA basadas en LLMs (generación de tests desde Jira/Xray, análisis de fallos desde reportes JUnit/Cucumber) integradas en pipelines GitLab CI. Performance con JMeter, seguridad con OWASP ZAP. Métricas y dashboards de QA (cobertura, tasa de éxito, defectos por severidad). Proyectos cross-funcionales con Playwright. Web test executor con HTML/CSS/JS para ejecutar y monitorizar tests con logs en tiempo real.

Cucumber REST Assured Java LLMs GitLab CI JMeter OWASP ZAP
2019 — 2022 VASS QA Architect & QA Lead Una arquitectura de QA construida desde cero.

Clientes: Prosegur, Redsys y Bankinter · Jul 2019 – Sep 2022

Diseñé e implementé un framework de QA completo desde cero (Robot Framework para web/mobile/REST API) integrado en Jenkins y Azure DevOps. Pruebas de carga y estrés con JMeter sobre HTTP/API, Azure Service Bus y MQTT. Monitorización con Azure Application Insights y Grafana, traduciendo métricas en recomendaciones para stakeholders. Desarrollo del producto interno QAWAT (Quality Assurance Web Application Testing) con demos a clientes potenciales. En Bankinter: automatización API/web (Postman/Newman, Katalon) y testing PSD2 en Agile/Scrum.

Robot Framework Jenkins Azure DevOps JMeter Grafana Katalon
2018 — 2019 MásMóvil QA Automation Engineer Automatización de APIs, web y generación de datos.

A través de MTP · Telecomunicaciones · Dic 2018 – Jul 2019

Automatización API y web con Postman/Newman, Katalon y Selenium, integrada en pipelines CI con Jenkins. Diseño de generadores de datos de test basados en API y creación de tests de carga con JMeter. Testing E2E y de integración en entorno Agile.

Selenium Postman Katalon Jenkins
2016 — 2018 GFI Informática QA Analyst De testing funcional a automatización y BDD.

Clientes: BBVA y DGT · Abr 2016 – Dic 2018

En BBVA: testing funcional y automatizado con framework interno Java/Selenium, aplicando BDD (Cucumber/Gherkin) en squads Agile, gestión de defectos, testing de integración y soporte en entornos Linux. Antes en DGT: testing funcional manual y automatizado con UFT, diseño de casos de test y gestión de defectos con TestLink/Mantis.

Selenium Java Cucumber UFT
2014 — 2016 Cetelem IT Analyst & QA Junior El inicio: conectar negocio, proyectos y tecnología.

BNP Paribas · Servicios financieros · Jul 2014 – Mar 2016

Tres etapas formativas: Compliance (cumplimiento normativo y control), coordinación entre IT y Producto , y la oficina de proyectos (gestión y coordinación). Primer contacto profundo con el mundo IT antes de especializarme en QA.

PMO Compliance

02 — TRABAJO SELECCIONADO

Ideas que se
pueden explorar.

Todos los proyectos
CASO 01 / PROYECTO PROPIO

AI Testing Lab Un laboratorio para
poner a prueba la IA.

De un primer test de LLM a un caso end-to-end de chatbot regulado, con incidente, runbook y postmortem.

Python / pytest DeepEval RAGAS
Explorar el laboratorio
AI TESTING LAB QA / LLM
20 módulos independientes
01 Evaluación de respuestas
02 Calidad de recuperación RAG
03 Seguridad y robustez
04 Observabilidad e incidentes
pytest Sin API key para la suite completa ↗
EL RETO

Evaluar más que una respuesta correcta.

En LLMs y RAG, la calidad también implica seguridad, consistencia, recuperación de contexto y capacidad de investigar fallos.

MI APORTACIÓN

Convertir la evaluación en práctica.

Un laboratorio modular en pytest que reúne DeepEval, RAGAS, Garak, Guardrails AI y OpenTelemetry con un caso de extremo a extremo.

EVIDENCIA

Código que puedes inspeccionar.

763 tests organizados en 20 módulos independientes. Código y ejemplos disponibles para revisar cómo se plantean las pruebas y qué cubre cada módulo.

Abrir repositorio

EXPLORA EL CATÁLOGO

Todos mis proyectos.

Ver GitHub ↗

VortexArenaAI

2026

VortexArenaAI

🎮 58 misiones · 4 mundos · Coach IA

Ver detalles y tecnologías

Plataforma gamificada para aprender IA como un juego de rol: eliges tu rol, completas 58 misiones reales en 4 mundos, ganas XP, subes de nivel y compites en un ranking global. Un Coach IA evalúa las respuestas de texto libre con un LLM (Google Gemini) y da feedback inmediato; el veredicto (passed/score/XP) se calcula en el servidor con Supabase Edge Functions, así que las respuestas correctas nunca se filtran al cliente. Incluye repaso espaciado (SRS), meta diaria, sistema de energía, logros, rachas y certificados verificables públicamente.

React TypeScript Vite Tailwind CSS Supabase PostgreSQL Edge Functions Deno LLMs Gemini Vitest PWA
MNEMO QA MEMORY / CI → TRIAGE → EVIDENCE

2026

Mnemo — QA Memory

Memoria de QA · Triaje · Evidencia verificable

Ver detalles y tecnologías

Plataforma de memoria operativa de QA que conecta conocimiento del proyecto, fallos, tests y CI. Incluye triaje de fallos, planes de prueba basados en la memoria, onboarding, generación de automatización y actas de release firmadas con Ed25519 y verificables. Embeddings locales, Ollama por defecto y revisión humana para las propuestas de cambio. Evolución de SmartErrorDebugger.

Python FastAPI Next.js PostgreSQL pgvector Ollama pytest TypeScript
AI Testing Lab

2025

AI Testing Lab

🧪 763 tests QA de LLM · 0 llamadas API

Ver detalles y tecnologías

Laboratorio práctico en pytest que cubre todas las capas de QA para sistemas LLM — desde tu primer LLMTestCase hasta un caso end-to-end de chatbot regulado con incidente, runbook y postmortem. 763 tests en 20 módulos independientes, basado en DeepEval, RAGAS, Garak, Guardrails AI y OpenTelemetry. Sin API key para ejecutar la suite completa.

pytest DeepEval RAGAS Garak Guardrails AI OpenTelemetry LLMs RAG Red Teaming AI
AI Testing Lab
LLM Eval Lab

2025

LLM Eval Lab

📊 6 evaluadores · 4 proveedores LLM

Ver detalles y tecnologías

Framework QA completo para evaluar chatbots IA. Combina 6 evaluadores (rule-based, safety, RAGAS, DeepEval, consistency, LLM-as-judge) sobre Groq, Gemini, Mistral y OpenRouter. 43 test cases en categorías funcional, safety, regression y multi-turn, modos plain y RAG, dashboard interactivo en Streamlit y CI/CD con lint, type check y cobertura.

Python pytest RAGAS DeepEval Streamlit LLMs RAG Groq Gemini Mistral AI CI/CD
LLM Eval Lab
AI Test Failure Analyzer

2025

AI Test Failure Analyzer

⚡️ Reduce tiempo de triage un 60%

Ver detalles y tecnologías

Framework construido con LLMs en local con Ollama con el objetivo de analizar reportes JUnit/Cucumber/Playwright y diagnostica automáticamente la causa raíz de los fallos. El objetivo es ahorrar tiempo en el análisis de los errores en las ejecuciones de tests automáticos.

Python LLMs Ollama AI CI/CD
AI Test Generator

2024

AI Test Generator

🕒 -70% Esfuerzo Definición de Tests

Ver detalles y tecnologías

Generador automático de tests en formato Gherkin. Esta herramienta analiza las historias de usuario o tareas de jira del sprint o el backlog y mediante un modelo de IA en local con Ollama genera los tests y los sube a jira xRay.

Python Jira API Gherkin Xray AI
Playwright Framework

2024

Playwright Framework

🛡 Arquitectura Zero-Flakiness

Ver detalles y tecnologías

Framework E2E modular diseñado para escalabilidad. Incluye abstracciones de patrones, lógica de reintentos y ejecución Dockerizada.

TypeScript Playwright Docker GitHub Actions
SmartVisionQA

2024

SmartVisionQA

👁 Validación Pixel-Perfect

Ver detalles y tecnologías

Herramienta en Python que utiliza IA en local con Ollama para detectar cambios visuales entre distintas versiones de una web. El objetivo es explorar cómo la automatización de QA puede apoyarse en modelos ligeros de visión para identificar cambios en la interfaz, colores, texto o estructura visual.

Python Docker AI LLMs Ollama
kafka-qa-framework

2024

kafka-qa-framework

Este proyecto implementa un framework de pruebas automatizadas diseñado para validar arquitecturas orientadas a eventos (Event-Driven Architectures) basadas en Apache Kafka.

Ver detalles y tecnologías

Este proyecto implementa un framework de pruebas automatizadas diseñado para validar arquitecturas orientadas a eventos (Event-Driven Architectures) basadas en Apache Kafka. El objetivo principal es asegurar la integridad, transformación y calidad de los datos que fluyen a través de pipelines de datos asíncronos.

Kafka Python Docker Data Pipelines
etl-qa-framework

2024

etl-qa-framework

Un framework de automatización de QA centrado en datos para validar pipelines ETL/ELT en entornos Big Data, garantizando la integridad y calidad de extremo a extremo mediante ejecución basada en YAML, validaciones con Great Expectations y componentes preparados para la nube como AWS S3 y Delta Lake..

Ver detalles y tecnologías

Un framework de automatización de QA centrado en datos para validar pipelines ETL/ELT en entornos Big Data, garantizando la integridad y calidad de extremo a extremo mediante ejecución basada en YAML, validaciones con Great Expectations y componentes preparados para la nube como AWS S3 y Delta Lake.

ETL Python Docker pytest AWS S3 Delta Lake
WordMate.es

2024

WordMate.es

Plataforma full-stack con rutas de estudio potenciadas por IA

Ver detalles y tecnologías

WordMate es una plataforma inteligente para aprender inglés centrada en ampliar vocabulario y medir el progreso real. Incluye rutas personalizadas, listas de vocabulario propias, tarjetas, quizzes y un panel de analíticas claro. Con práctica de repetición espaciada, rachas diarias y un sistema de progresión de 10 niveles, WordMate ayuda a mejorar el vocabulario de forma sencilla y motivadora.

HTML CSS JavaScript MySQL PHP TensorFlow AI
REST Assured Cucumber Framework

2023

REST Assured Cucumber Framework

Framework de automatización de pruebas de API REST con Cucumber BDD, Rest Assured y Java.

Ver detalles y tecnologías

Framework de automatización de pruebas de API REST con Cucumber BDD, Rest Assured y Java. Incluye pruebas CRUD completas, integración CI/CD y compatibilidad con múltiples entornos.

Cucumber REST Assured BDD Java
Karate API Framework

2023

Karate API Framework

📋 Cobertura API contract-first

Ver detalles y tecnologías

Suite de pruebas API contract-first con Karate DSL para validar endpoints REST en flujos de autenticación, manejo de errores e integridad de datos. Cubre escenarios CRUD con scenario outlines, ejecución paralela y reporting HTML integrado. Integrado en CI con Maven.

Java Karate API Maven CI/CD
MNEMO QA MEMORY / CI → TRIAGE → EVIDENCE

2023

JMeter Performance Tests

⚡ Regresiones de latencia detectadas en CI

Ver detalles y tecnologías

Suite de pruebas de carga y estrés con Apache JMeter para APIs REST y flujos web. Incluye configuraciones de thread groups para escenarios de ramp-up, soak y spike, con assertions de umbral integradas en CI para bloquear builds ante regresiones de latencia.

JMeter Performance CI/CD Load Testing
MNEMO QA MEMORY / CI → TRIAGE → EVIDENCE

2023

Playwright + Jenkins CI

🔄 Cero ciclos de regresión manual

Ver detalles y tecnologías

Suite E2E con Playwright y TypeScript integrada en un pipeline declarativo de Jenkins. Ejecuta pruebas cross-browser en Chromium, Firefox y WebKit en paralelo, genera reportes Allure en cada build y bloquea merges cuando la cobertura cae por debajo del umbral.

Playwright TypeScript Jenkins Allure CI/CD
Selenium Automation Project

2022

Selenium Automation Project

Framework robusto de Selenium WebDriver con Java, implementando Page Object Model y TestNG..

Ver detalles y tecnologías

Framework robusto de Selenium WebDriver con Java, implementando Page Object Model y TestNG.

Selenium Java TestNG POM
MNEMO QA MEMORY / CI → TRIAGE → EVIDENCE

2022

Locust Performance Testing

Framework de pruebas de carga con Locust para performance y estrés..

Ver detalles y tecnologías

Framework de pruebas de carga con Locust para performance y estrés.

Locust Python Load Testing
MNEMO QA MEMORY / CI → TRIAGE → EVIDENCE

2022

Robot Framework API

Suite de pruebas API construida con Robot Framework, con enfoque keyword-driven..

Ver detalles y tecnologías

Suite de pruebas API construida con Robot Framework, con enfoque keyword-driven.

Robot Framework API Testing Python
Manual de QA para Sistemas de Inteligencia Artificial, segunda edición

03 — PUBLICACIÓN

El conocimiento
también se construye
compartiéndolo.

Manual de QA para Sistemas de Inteligencia Artificial

LLMs, RAG, chatbots y agentes. Una guía de referencia profesional sobre evaluación, seguridad, quality gates y observabilidad.

193 páginas 33 capítulos 2.ª edición · 2026

Contenido del manual en español · 4 apéndices

Índice del manual 33 capítulos · 4 apéndices
  1. 01. Introducción a la IA generativa
  2. 02. Fundamentos técnicos de los LLMs
  3. 03. Riesgos, calidad y marco normativo
  4. 04. Por qué QA AI no es QA tradicional
  5. 05. Taxonomía de sistemas conversacionales
  6. 06. RAG: Retrieval-Augmented Generation
  7. 07. Métricas RAGAS y evaluación de RAG
  8. 08. LLM-as-Judge: evaluación con modelos
  9. 09. Golden Datasets y datos de referencia
  10. 10. Testing de chatbots: manual y automático
  11. 11. Evaluación semántica y similitud
  12. 12. Robustness y perturbation testing
  13. 13. Deriva semántica y monitorización
  14. 14. Seguridad: OWASP LLM Top 10 (2025)
  15. 15. Prompt Injection y ataques adversariales
  16. 16. Evaluación multi-turno y contexto
  17. 17. Alucinaciones: tipos y detección
  18. 18. CI/CD y quality gates en pipelines AI
  19. 19. Observabilidad y trazabilidad
  20. 20. Herramientas: RAGAS, TruLens, DeepEval
  21. 21. Testing de agentes y sistemas multi-agente
  22. 22. Antipatrones y errores en evaluación LLM
  23. 23. Estrategia integral de QA AI
  24. 24. Prompt Regression Testing
  25. 25. Bias, Toxicity y Safety Testing
  26. 26. Antipatrones operativos y su remediación
  27. 27. Cost-aware QA y observabilidad de costes
  28. 28. Privacy y PII leakage testing
  29. 29. Retrieval avanzado y testing
  30. 30. Function calling y tool use testing
  31. 31. Human-in-the-loop e inter-annotator agreement
  32. 32. Reproducibilidad y determinismo
  33. 33. Glosario consolidado
  • Apéndice A — Preguntas de Consolidación Técnica (45 preguntas)
  • Apéndice B — Referencias y lecturas recomendadas
  • Apéndice C — Índice alfabético
  • Apéndice D — Caso práctico end-to-end (chatbot RAG regulado)
Vista previa · Capítulo 1 de 33

01. Introducción a la IA generativa

1.1 Qué entendemos por IA en este manual

Antes de hablar de cómo testar IA, hace falta acordar de qué estamos hablando. La inteligencia artificial es la rama de la informática que construye sistemas capaces de hacer tareas que antes solo hacían las personas: entender lenguaje, reconocer objetos, planificar acciones o generar contenido nuevo. Russell & Norvig (2021), en el manual de referencia Artificial Intelligence: A Modern Approach (4ª ed.), articulan la definición canónica del campo en torno a la idea de un agente que actúa racionalmente para maximizar el valor esperado de un objetivo dado.

Esa definición es útil pero abstracta. Para QA conviene una definición operativa, que sirva para decidir si lo que tenemos delante es «software de toda la vida» o «software de IA»:

IA es cualquier sistema cuyo comportamiento se aprende de datos, en lugar de programarse línea a línea con reglas.

Esa diferencia — comportamiento aprendido en lugar de programado — es la que rompe los pilares del QA clásico. En software tradicional, el código siempre devuelve lo mismo ante la misma entrada, así que tiene sentido hablar de cobertura de ramas, oráculo de tests por igualdad exacta y regresión comparando byte a byte. En IA, la misma entrada puede dar respuestas distintas, el oráculo «correcto» no siempre existe, y la regresión se mide en distribuciones. El resto del manual explica cómo se adapta el QA a esa nueva realidad.

Cuando se habla de «IA» en prensa se mezclan tres niveles muy distintos. Conviene tenerlos separados:

  • IA débil o narrow AI. Sistemas que resuelven una tarea o dominio acotado. Toda la IA en producción en 2026 es narrow.
  • IA general (AGI). Sistema hipotético con capacidades cognitivas comparables a las humanas en cualquier dominio. No existe.
  • IA superhumana. Sistema hipotético que supera al humano en cualquier tarea cognitiva. Fuera del scope.

1.2 Espectro de la IA

No toda IA es IA generativa. En un sistema real conviven cuatro familias o paradigmas, cada uno con su forma de funcionar y sus implicaciones para QA. La tabla siguiente las sitúa de menor a mayor complejidad estadística:

Tabla 1.1 — Espectro de paradigmas de IA y su huella en QA.
Paradigma Cómo funciona Ejemplo Implicación QA
IA simbólica Reglas lógicas explícitas Safety filter declarativo, allowlist de tools Tests basados en reglas (software clásico)
ML clásico Aprendizaje a partir de features ingenierizadas Classifier de intent, detector PII Métricas estadísticas (accuracy, precision, recall)
Deep learning Redes neuronales que aprenden representaciones CNN imagen, RNN texto Métricas estadísticas + análisis por subgrupo
Generative AI Modelos que generan contenido nuevo LLM, modelo de difusión, multimodal Métricas semánticas, faithfulness, robustness

En 2026, la mayoría de sistemas conversacionales en producción son IA generativa basada en arquitecturas transformer (el motor detrás de ChatGPT, Claude o Gemini). La IA simbólica no ha desaparecido: sigue viva en guardrails declarativos, validación de esquemas JSON y motores de reglas de negocio. Un sistema QA maduro testa los dos paradigmas con métricas distintas; los capítulos siguientes lo desarrollan.

1.3 Tipos de aprendizaje automático

Dentro del aprendizaje automático (machine learning, ML) hay varias formas de aprender, y cada una se mide con métricas distintas. Saber qué tipo de aprendizaje usa el subsistema bajo test es lo que decide si vale más medir con precision/recall, con perplexity o con win-rate. Los cinco tipos canónicos son:

Tabla 1.2 — Tipos de aprendizaje automático y relevancia para QA AI.
Tipo Qué aprende Ejemplo en QA AI Métrica típica
Supervised Mapeo input → label etiquetado Classifier de intent; detector de PII Precision, recall, F1
Unsupervised Estructura latente sin etiquetas Clustering de queries Silhouette, ARI
Semi-supervised Etiquetas escasas + pools no etiquetados Bootstrap de golden dataset Métrica supervisada sobre validación
Self-supervised Etiquetas derivadas del propio input Pre-training de LLMs (next-token prediction) Perplexity, downstream eval
Reinforcement Política por recompensa RLHF para alineación Reward model score, win-rate

Un detalle clave: un LLM moderno no usa un solo tipo de aprendizaje, sino los tres últimos en cadena. Primero aprende lenguaje de forma self-supervised (pre-training); luego se le enseña a seguir instrucciones de forma supervised (instruction tuning); finalmente se ajusta por refuerzo con feedback humano (RLHF, DPO o RLAIF). El §2.5 del Cap. 2 desarrolla cada etapa y por qué cada una abre modos de fallo distintos.

1.4 Modelos discriminativos vs generativos

Dentro de la IA hay dos grandes formas de plantear un problema: discriminar (elegir entre opciones conocidas) y generar (producir contenido nuevo). Un clasificador de spam discrimina entre «spam / no spam»; un LLM como GPT-4 genera texto que antes no existía. La diferencia parece sutil pero cambia por completo cómo se testa el sistema, porque cambia el oráculo: en discriminativo hay una respuesta «correcta»; en generativo hay infinitas respuestas válidas.

Tabla 1.3 — Modelos discriminativos vs generativos.
Aspecto Discriminativo Generativo
Qué modela P(label | input) P(output | input), muestreando
Output típico Clase, score, valor numérico Texto, imagen, audio, secuencia
Determinismo Alto con threshold fijo Bajo por naturaleza
Oráculo de test Etiqueta esperada Criterio semántico (similitud, faithfulness)
Métricas Confusion matrix, ROC/AUC, F1 RAGAS, LLM-as-Judge, embedding similarity
Coste por inferencia Bajo Medio a alto

En la práctica, los sistemas reales combinan los dos enfoques. Un chatbot RAG típico tiene cuatro componentes encadenados: un clasificador de intent (discriminativo, decide a qué se refiere la pregunta), un filtro de safety (discriminativo, decide si la pregunta es legítima), un retriever que ordena los documentos más relevantes (ranking discriminativo) y, al final, un LLM generativo que produce la respuesta. Cada uno se testa con su propia métrica.

1.5 Panorama de IA generativa en 2026

La IA generativa no es solo «chatbots de texto». Cada modalidad (texto, código, imagen, audio, vídeo, multimodal) tiene sus casos de uso típicos, sus modelos de referencia y, sobre todo, sus tests específicos. Este manual cubre principalmente texto, pero conocer el resto del panorama ayuda a situar los proyectos en los que vas a trabajar:

Tabla 1.4 — Panorama de IA generativa por modalidad (revisión 2026-04).
Modalidad Tareas Ejemplos Tests específicos
Texto Q&A, resumen, redacción, código GPT-4o, Claude Sonnet 4.x, Llama 3/4, Mistral, Qwen Faithfulness, factual accuracy, robustness
Código Autocompletado, refactor Copilot, Cursor, Codeium Compilable, tests pasan, sin vulnerabilidades
Imagen Text-to-image, edición DALL·E 3, Stable Diffusion, Midjourney Adherencia a prompt, NSFW, watermarking
Audio TTS, STT, generación Whisper, ElevenLabs, OpenVoice WER, MOS, latencia TTFT
Vídeo Generación, edición Sora, Veo, Runway Coherencia temporal, fidelidad
Multimodal Texto + imagen + audio GPT-4o, Claude Sonnet 4.x, Gemini 2 Cross-modal grounding, cross-modal hallucination

Este manual se centra en la modalidad texto / conversacional, que es la que más ha penetrado en producción empresarial. La multimodalidad se introduce en el §2.6 del Cap. 2, lo justo para situarla; un capítulo dedicado queda pendiente para futuras versiones.

1.6 Posicionamiento del manual

Si vienes del mundo ISTQB es importante saber dónde encaja este manual respecto a las certificaciones existentes. El syllabus ISTQB tiene dos niveles relacionados con IA, y este manual se alinea sobre todo con el primero:

Tabla 1.5 — Posicionamiento del manual.
Recurso Audiencia Enfoque
ISTQB Foundation Level QA generalista Software testing clásico
ISTQB CT-AI v1.0 QA en transición a IA Fundamentos AI; probar sistemas IA
ISTQB CT-GenAI v1.0 QA con base CT-AI Usar IA generativa para probar software (AI-augmented testing)
Manuales de proveedor Equipos sobre un stack Vendor-specific
Este manual QA AI Engineer / SDET / AI Quality Engineer Práctico; vertical LLMs / RAG / chatbots / agentes

1.7 Mapa del manual

El cuerpo del manual recorre treinta y tres capítulos en orden secuencial. Sobre esa secuencia se superponen siete agrupaciones temáticas transversales que ayudan a localizar el material por área funcional. La agrupación es conceptual, no estructural: los capítulos siguen un orden de lectura lineal y las partes solo señalan «de qué trata cada bloque».

  • Parte I — Fundamentos (Cap. 1-3). Bases para un QA Engineer en transición.
  • Parte II — De QA tradicional a QA AI (Cap. 4-5). Cambio de paradigma y taxonomía de sistemas.
  • Parte III — Sistemas y arquitecturas (Cap. 6, 21, 29-30). RAG, retrieval avanzado, agentes, function calling.
  • Parte IV — Evaluación (Cap. 7-9, 11). RAGAS, LLM-as-Judge, evaluación semántica, golden datasets.
  • Parte V — Dominios de testing (Cap. 10, 12, 16-17). Chatbots, robustness, multi-turno, alucinaciones.
  • Parte VI — Seguridad, privacidad y riesgo (Cap. 14-15, 25, 28). OWASP LLM, prompt injection, bias, PII.
  • Parte VII — Operaciones y madurez (Cap. 13, 18-20, 22-24, 26-27, 31-33). CI/CD, observabilidad, deriva, reproducibilidad, costes, HITL, regression, herramientas, antipatrones, estrategia, glosario.

Los apéndices A-D aportan 45 preguntas de consolidación, referencias bibliográficas, índice alfabético y un caso práctico end-to-end.

1.8 Ruta mínima de lectura

114 páginas dan para mucho, pero no hace falta leerlas en orden estricto. Si vienes de QA clásico sin experiencia previa en ML o LLMs, la ruta más eficiente para llegar pronto a productivo es:

  • Cap. 1 (este): panorama y vocabulario inicial.
  • Cap. 2: cómo funciona un LLM por dentro (tokens, embeddings, parámetros de inferencia, tipos de LLM).
  • Cap. 3: riesgos, calidad y marco normativo.
  • Cap. 4: por qué QA AI no es QA tradicional (puerta de entrada al cuerpo principal).
  • Continúa por la parte que cubra tu caso de uso (RAG → Cap. 6; safety → Cap. 14-15, 25; CI/CD → Cap. 18).

04 — PERFIL TÉCNICO

Profundidad técnica.
Visión de conjunto.

Testing, desarrollo y negocio conectados en una misma estrategia de calidad.

Consultar todas las tecnologías ↗
Automatización

Playwright, Karate DSL, REST Assured,
Robot Framework, Selenium

Desarrollo & CI/CD

Python, Java, TypeScript · GitLab CI,
Jenkins, Azure DevOps

Certificaciones

ISTQB CTFL · CT-TAS · CT-MAT · CT-GenAI

Idiomas

Español nativo · Inglés intermedio

En profundidad: mi enfoque profesional

Senior QA Automation Engineer & SDET especializado en AI Quality Engineering , con foco en la evaluación de LLMs, chatbots y sistemas RAG. Diseño estrategias y suites de testing para validar calidad, seguridad, robustez y regresión en soluciones basadas en IA, incluyendo prompt regression, evaluación de respuestas y AI Red Teaming alineado con OWASP LLM Top 10. Llevo 10+ años llevando calidad a equipos de servicios financieros, telecomunicaciones, retail y ciberseguridad.

Certificado ISTQB CT-GenAI , CT-TAS, CT-MAT y CTFL. Construyo frameworks de automatización desde cero (Playwright, Karate DSL, REST Assured, Robot Framework, Selenium) integrados en pipelines GitLab CI / Jenkins / Azure DevOps. Mi diferencial: convertir la calidad en una capa de IA observable, evaluable y testeable, no en una checklist manual.

Todas las tecnologías

AI Tooling

RAGAS DeepEval promptfoo BERTScore LangSmith Ollama ChromaDB Claude Code Gemini CLI Codex Skills HuggingFace LangChain LangGraph MCP Embeddings

Testing y QA

Playwright REST Assured Robot Framework Selenium Karate DSL Cucumber / BDD pytest TestNG JUnit Postman / Newman Appium Pact

Lenguajes de Programación

Python Java JavaScript TypeScript SQL Bash

CI/CD y DevOps

GitLab CI Jenkins GitHub Actions Azure DevOps Allure Reports SonarQube

Performance y Observabilidad

JMeter Locust Azure Application Insights Grafana OWASP ZAP k6

Cloud e Infraestructura

Google Cloud Platform Azure Docker AWS Kubernetes

Datos y Event-Driven

SQL BigQuery Pub/Sub Apache Kafka PostgreSQL MySQL Oracle SQL RabbitMQ

¿HABLAMOS?

Tu próximo reto.
Mi siguiente aportación.

Descarga segura

Solicitar mi CV

Te enviaré un enlace privado de descarga a tu email en segundos.

Sólo usaré tu email para enviarte el enlace de descarga. Sin tracking ni spam.