← Todos los artículos
INTELIGENCIA ARTIFICIAL

Ingeniería de IA: evaluaciones, observabilidad y seguridad para sistemas confiables AI engineering: evaluations, observability, and security for reliable systems

15 de julio de 2026
18 min · ~3,600 palabras

Una solución de IA puede responder correctamente durante una demostración y fallar cuando se expone a usuarios, documentos y situaciones reales. Los modelos generativos son probabilísticos: pequeñas variaciones en la entrada, el contexto o la versión del modelo pueden modificar su comportamiento.

Evaluar más allá de una respuesta convincente

Evaluating beyond a convincing response

La fluidez no demuestra exactitud. Una respuesta puede parecer profesional y contener datos incorrectos, referencias inexistentes o conclusiones no respaldadas. La evaluación debe partir de criterios relacionados con la tarea: precisión, completitud, fundamentación, formato, tono, cumplimiento normativo y utilidad.

Fluency does not demonstrate accuracy. A response can look professional and contain incorrect data, non-existent references, or unsupported conclusions. Evaluation should start with task-related criteria: accuracy, completeness, grounding, format, tone, regulatory compliance, and utility.

Para aplicaciones con recuperación de información conviene separar la calidad de la búsqueda de la calidad de la generación. Se debe medir si se recuperaron fuentes relevantes, si la respuesta se apoyó en ellas y si evitó introducir afirmaciones externas. Para agentes, también se evalúan la selección de herramientas, la secuencia de pasos, la finalización de la tarea y el respeto de límites.

For information retrieval applications, it is advisable to separate search quality from generation quality. It should be measured whether relevant sources were retrieved, whether the response relied on them, and whether it avoided introducing external statements. For agents, tool selection, step sequence, task completion, and boundary compliance are also evaluated.

Una métrica aislada rara vez describe toda la calidad. Es preferible combinar reglas deterministas, comparación con respuestas esperadas, evaluadores basados en modelos y revisión humana.

A single metric rarely describes overall quality. It is preferable to combine deterministic rules, comparison with expected responses, model-based evaluators, and human review.

Cómo construir un conjunto de evaluación

How to build an evaluation set

El conjunto debe representar el uso real. Incluye solicitudes frecuentes, casos difíciles, entradas incompletas, idiomas, formatos, datos sensibles, intentos adversariales y fallos de dependencias. Los ejemplos deben vincularse a criterios claros, no solo a una respuesta textual exacta.

The set should represent real usage. It includes frequent requests, difficult cases, incomplete inputs, languages, formats, sensitive data, adversarial attempts, and dependency failures. Examples should be linked to clear criteria, not just exact textual responses.

Conviene mantener un conjunto estable para regresión y otro conjunto cambiante obtenido de producción. El primero permite comparar versiones; el segundo detecta patrones emergentes. Los casos donde usuarios corrigen, abandonan o escalan una interacción son candidatos valiosos.

It is advisable to maintain a stable set for regression and a changing set obtained from production. The first allows comparing versions; the second detects emerging patterns. Cases where users correct, abandon, or escalate an interaction are valuable candidates.

Cada cambio en prompt, modelo, temperatura, herramienta, índice o política debe evaluarse. La comparación debe considerar calidad, latencia y costo, porque una mejora marginal puede no justificar un aumento considerable de consumo.

Any change in prompt, model, temperature, tool, index, or policy must be evaluated. The comparison should consider quality, latency, and cost, because a marginal improvement may not justify considerable increased consumption.

Observabilidad nativa para IA

Native observability for AI

La observabilidad tradicional responde si el sistema está disponible. La observabilidad de IA debe responder además si el sistema está actuando bien. Para ello registra entradas, salidas, contexto recuperado, versiones, decisiones, invocaciones de herramientas, filtros, evaluaciones, costos y retroalimentación.

Traditional observability answers whether the system is available. AI observability must additionally answer whether the system is performing well. To do this, it logs inputs, outputs, retrieved context, versions, decisions, tool invocations, filters, evaluations, costs, and feedback.

Las trazas permiten seguir una ejecución completa. En un agente, cada paso debe aparecer como un segmento relacionado con la solicitud original. Esto ayuda a detectar ciclos, herramientas lentas, errores de autorización o pérdida de contexto. Los logs deben estructurarse y proteger datos personales; registrar todo sin clasificación puede crear un nuevo riesgo.

Traces allow following a complete execution. In an agent, each step should appear as a segment related to the original request. This helps detect cycles, slow tools, authorization errors, or context loss. Logs should be structured and protect personal data; logging everything without classification can create a new risk.

Los tableros deben combinar indicadores técnicos y de producto: tasa de éxito, exactitud estimada, solicitudes rechazadas, escalamiento humano, tokens por tarea, costo por resultado, latencia por componente y violaciones de políticas.

Dashboards should combine technical and product indicators: success rate, estimated accuracy, rejected requests, human escalation, tokens per task, cost per result, latency per component, and policy violations.

Seguridad desde el diseño

Security by design

Los sistemas de IA introducen superficies de ataque particulares. El prompt injection intenta insertar instrucciones mediante mensajes o documentos. La extracción de información busca revelar datos, prompts o credenciales. El abuso de herramientas pretende convertir una interpretación del modelo en una acción no autorizada.

AI systems introduce particular attack surfaces. Prompt injection attempts to insert instructions via messages or documents. Information extraction seeks to reveal data, prompts, or credentials. Tool abuse attempts to convert a model interpretation into an unauthorized action.

La defensa debe estar en varias capas. El modelo recibe instrucciones claras, pero las API aplican autorización real. Las herramientas validan esquemas y restringen parámetros. Los datos se clasifican y enmascaran. Las acciones de alto impacto requieren aprobación. Las salidas pasan por validaciones antes de consumirse en otros sistemas.

Defense must be in multiple layers. The model receives clear instructions, but APIs apply real authorization. Tools validate schemas and restrict parameters. Data is classified and masked. High-impact actions require approval. Outputs undergo validation before consumption in other systems.

Ningún filtro único elimina el riesgo. La protección efectiva combina aislamiento de contenido, privilegio mínimo, allowlists, límites de ejecución, revisión humana, detección y capacidad de respuesta.

No single filter eliminates risk. Effective protection combines content isolation, least privilege, allowlists, execution limits, human review, detection, and response capability.

Red teaming y pruebas adversariales

Red teaming and adversarial testing

Las pruebas adversariales simulan cómo un usuario malicioso o una fuente contaminada puede alterar el comportamiento. Deben probar instrucciones indirectas dentro de documentos, codificaciones, cambios de idioma, solicitudes fragmentadas, conflictos de autoridad y combinaciones de herramientas.

Adversarial testing simulates how a malicious user or contaminated source can alter behavior. They should test indirect instructions within documents, encodings, language changes, fragmented requests, authority conflicts, and tool combinations.

En agentes, el red teaming también examina consecuencias: envío de mensajes, modificación de registros, acceso lateral y acumulación de acciones aparentemente pequeñas. Los equipos deben verificar si el sistema conserva restricciones durante flujos largos y delegaciones.

In agents, red teaming also examines consequences: message sending, record modification, lateral access, and accumulation of seemingly small actions. Teams must verify whether the system preserves restrictions during long flows and delegations.

Los hallazgos se convierten en nuevos casos de evaluación, reglas, controles de herramienta y alertas. Así se crea un ciclo donde cada incidente o prueba fortalece la cobertura.

Findings become new evaluation cases, rules, tool controls, and alerts. This creates a cycle where each incident or test strengthens coverage.

Integración con CI/CD y gobierno

Integration with CI/CD and governance

Las evaluaciones deben formar parte del pipeline. Una versión no se promueve si cae por debajo de los umbrales de calidad o seguridad. Los resultados necesitan versionado junto con prompts, modelos, datos y configuraciones para asegurar reproducibilidad.

Evaluations should be part of the pipeline. A version is not promoted if it falls below quality or security thresholds. Results need versioning along with prompts, models, data, and configurations to ensure reproducibility.

El gobierno define quién puede cambiar modelos, conectar fuentes, publicar herramientas y aprobar excepciones. También establece retención de conversaciones, tratamiento de datos sensibles, revisión de proveedores y gestión de incidentes. Un registro de modelos y agentes permite conocer qué está desplegado y quién responde por ello.

Governance defines who can change models, connect sources, publish tools, and approve exceptions. It also establishes conversation retention, sensitive data handling, vendor review, and incident management. A model and agent registry allows knowing what is deployed and who is responsible for it.

Los umbrales deben relacionarse con el riesgo. Un generador de borradores admite revisión humana y puede tolerar más variabilidad. Un agente que ejecuta pagos necesita controles mucho más estrictos.

Thresholds should relate to risk. A draft generator admits human review and can tolerate more variability. An agent executing payments needs much stricter controls.

Un ciclo operativo de mejora continua

An operational cycle of continuous improvement

La operación comienza con una línea base. Se despliega de forma gradual, se observan indicadores y se revisan muestras. Las interacciones problemáticas alimentan el conjunto de evaluación. Los cambios se prueban contra regresión y se publican mediante estrategias controladas.

Operation begins with a baseline. It deploys gradually, indicators are observed, and samples are reviewed. Problematic interactions feed the evaluation set. Changes are tested against regression and published through controlled strategies.

Este ciclo transforma la calidad de IA en una disciplina medible. La meta no es eliminar toda variación, algo incompatible con la naturaleza de los modelos, sino conocerla, mantenerla dentro de límites aceptables y detectar desviaciones.

This cycle transforms AI quality into a measurable discipline. The goal is not to eliminate all variation, something incompatible with model nature, but to know it, keep it within acceptable limits, and detect deviations.

Una ingeniería de IA sólida combina la experimentación rápida con controles de software empresarial. Evaluar antes, observar durante y aprender después permite que la IA sea útil sin convertirse en una caja negra imposible de gobernar.

Solid AI engineering combines rapid experimentation with enterprise software controls. Evaluate before, observe during, and learn after allows AI to be useful without becoming an ungovernable black box.

Conclusión

Conclusion

La adopción de esta tendencia debe estar guiada por problemas reales, métricas y controles. La tecnología aporta valor cuando reduce fricción, mejora decisiones y crea capacidades sostenibles. Empezar con un alcance medible, evaluar resultados y fortalecer la plataforma común permite avanzar sin convertir la innovación en deuda técnica.

Adoption of this trend should be guided by real problems, metrics, and controls. Technology delivers value when it reduces friction, improves decisions, and creates sustainable capabilities. Starting with measurable scope, evaluating results, and strengthening the common platform allows progress without turning innovation into technical debt.

Temas relacionados

Related topics

#LLMOps #Evaluación IA #Observabilidad #Seguridad IA #Guardrails #IA Responsable
CASO DE ÉXITO IA

Conoce PetVault — App Android construida con IA por NovaFox Labs

Colaboración recibida por Omar Saez creador de la siguiente app: Elexstudio App en Google Play

Ver en Google Play