Inteligencia Artificial: modelos, tokens y conceptos clave para entender cómo funciona
La Inteligencia Artificial (IA) dejó de ser un concepto reservado para laboratorios o películas de ciencia ficción. Hoy está presente en asistentes de código, chatbots, buscadores, editores de imágenes, sistemas de recomendación, automatizaciones y herramientas que usamos todos los días.
Pero para aprovecharla bien —ya sea como usuario, creador de contenido o desarrollador— conviene entender algunos conceptos fundamentales: qué es un modelo, cómo se procesan los textos, qué son los tokens, por qué existe un límite de contexto y cuándo una IA realmente puede “saber” algo.
La IA generativa no piensa ni comprende como una persona: detecta patrones y calcula cuál es la siguiente pieza de información más probable según el contexto disponible.
¿Qué es la Inteligencia Artificial?
La Inteligencia Artificial es un área de la informática que busca crear sistemas capaces de realizar tareas asociadas a la inteligencia humana: reconocer imágenes, entender texto, traducir idiomas, tomar decisiones, recomendar contenido o generar información.
Dentro de este campo existen varias ramas:
- Machine Learning: sistemas que aprenden patrones a partir de datos.
- Deep Learning: una rama del aprendizaje automático basada en redes neuronales con muchas capas.
- Procesamiento de Lenguaje Natural (NLP): técnicas para analizar, comprender y generar lenguaje humano.
- Visión por computadora: modelos capaces de interpretar imágenes y video.
- IA generativa: modelos que pueden crear texto, código, imágenes, audio o video.
Herramientas como ChatGPT, Claude, Gemini, Copilot, Midjourney y modelos locales como Llama, Mistral o Qwen pertenecen principalmente a la categoría de IA generativa.
¿Qué es un modelo de IA?
Un modelo es el componente que aprendió patrones a partir de una gran cantidad de datos durante el entrenamiento.
En el caso de un modelo de lenguaje, también llamado LLM (Large Language Model), el entrenamiento consiste en procesar enormes colecciones de texto y aprender relaciones entre palabras, fragmentos de palabras, frases, conceptos y estructuras de programación.
Cuando escribís una pregunta como:
Explicame qué es React con un ejemplo.
el modelo no busca una respuesta guardada exactamente con ese texto. En cambio, procesa tu instrucción, interpreta el contexto y genera una respuesta token por token, estimando qué continuación es más útil o probable.
Algunos tipos de modelos que conviene conocer:
| Tipo de modelo | Qué hace | Ejemplos de uso |
|---|---|---|
| LLM o modelo de lenguaje | Genera y analiza texto o código | Chatbots, asistentes de programación, resúmenes |
| Modelo multimodal | Procesa más de un tipo de dato | Analizar imágenes, documentos, audio y texto |
| Modelo de visión | Interpreta imágenes o video | OCR, detección de objetos, clasificación de imágenes |
| Modelo de difusión | Genera imágenes desde una descripción | Arte, mockups, imágenes de producto |
| Modelo de embeddings | Convierte contenido en vectores numéricos | Búsqueda semántica, RAG, recomendaciones |
¿Qué son los tokens?
Los modelos no leen texto exactamente como las personas. Antes de procesarlo, dividen el contenido en unidades llamadas tokens.
Un token puede representar:
- Una palabra completa.
- Parte de una palabra.
- Un signo de puntuación.
- Un número.
- Un espacio o una combinación frecuente de caracteres.
- Fragmentos de código.
Por ejemplo, una palabra larga o poco común puede dividirse en varios tokens. Lo mismo sucede con URLs, identificadores, JSON, código fuente o palabras en idiomas distintos.
"Hola, ¿cómo estás?"
Ese texto puede convertirse en varios tokens, como Hola, ,, ¿, cómo, estás y ?. La división exacta depende del tokenizer que use cada modelo.
¿Por qué importan los tokens?
Los tokens son importantes por tres motivos:
- Límite de contexto: determinan cuánta información puede recibir y procesar el modelo en una solicitud.
- Costo: muchas APIs cobran según los tokens de entrada y de salida.
- Rendimiento: prompts largos, documentos extensos y respuestas demasiado grandes aumentan el tiempo de procesamiento.
No existe una conversión universal entre palabras y tokens. Como estimación general, un texto puede requerir aproximadamente entre 1 y 2 tokens por palabra, aunque en español, código o contenido técnico el resultado puede variar bastante.
Ventana de contexto: la memoria de trabajo del modelo
La ventana de contexto es la cantidad máxima de tokens que un modelo puede considerar en una interacción.
Incluye mucho más que el mensaje actual:
- El prompt del sistema.
- Tus mensajes anteriores.
- Las respuestas previas del asistente.
- Archivos, imágenes o documentos adjuntos.
- Resultados de herramientas o búsquedas.
- Información agregada mediante RAG.
- La respuesta que el modelo todavía tiene que generar.
Podemos imaginarla como la memoria de trabajo de la conversación. Si el historial, los documentos y la respuesta esperada superan el límite, una parte del contenido debe resumirse, eliminarse o truncarse.
[ Instrucciones del sistema ]
[ Historial de conversación ]
[ Tu prompt ]
[ Documentos o contexto adicional ]
[ Respuesta generada ]
Tener una ventana de contexto grande permite analizar documentos extensos, repositorios de código o conversaciones largas. Sin embargo, más contexto no siempre significa una respuesta mejor: si se incluye información irrelevante, contradictoria o demasiado extensa, el modelo puede perder precisión.
Prompt: cómo pedirle algo a un modelo
Un prompt es la instrucción o el contexto que le damos a una IA para obtener un resultado.
Un prompt pobre suele generar una respuesta genérica:
Haceme un post sobre inteligencia artificial.
Un prompt con contexto suele producir algo más útil:
Escribí un post en Markdown para un blog de desarrollo frontend.
Explicá IA generativa, LLMs, tokens, ventana de contexto, RAG y alucinaciones.
Usá un tono claro, ejemplos cortos y orientalo a desarrolladores que trabajan con React y TypeScript.
Una estructura práctica para escribir prompts es:
Rol + tarea + contexto + formato + restricciones
Por ejemplo:
Actuá como redactor técnico.
Escribí una guía introductoria sobre RAG para desarrolladores frontend.
El público conoce React y APIs REST.
Usá Markdown, ejemplos en TypeScript y no superes las 1.000 palabras.
La calidad de la respuesta depende mucho de la claridad de la consigna, del contexto aportado y de la capacidad real del modelo elegido.
Temperatura y aleatoriedad
La temperatura es un parámetro que influye en cuánta variación o creatividad puede tener una respuesta.
- Temperatura baja: respuestas más consistentes, conservadoras y predecibles.
- Temperatura media: buen equilibrio para contenido general y asistentes.
- Temperatura alta: respuestas más variadas y creativas, pero con más riesgo de inconsistencias.
Para tareas técnicas, extracción de datos, generación de JSON, código o respuestas que necesitan ser repetibles, normalmente conviene una temperatura baja.
Para lluvia de ideas, títulos, copies, historias o propuestas creativas, una temperatura más alta puede resultar útil.
Embeddings: convertir significado en números
Los embeddings son representaciones numéricas de texto, imágenes u otros datos. Permiten comparar contenidos por significado, no solo por coincidencia literal de palabras.
Por ejemplo, estas dos consultas no son iguales, pero tienen una intención similar:
¿Cómo autentico usuarios con JWT?
Necesito implementar login con tokens en mi API.
Un sistema basado en embeddings puede detectar que ambas frases están relacionadas con autenticación, tokens y APIs.
Los embeddings se usan habitualmente para:
- Búsqueda semántica.
- Sistemas de recomendación.
- Detección de contenido similar.
- Agrupamiento de documentos.
- Recuperación de información para asistentes de IA.
- RAG.
RAG: conectar una IA con información propia
RAG significa Retrieval-Augmented Generation, o generación aumentada mediante recuperación de información.
Es una técnica que permite que un modelo responda usando documentos externos y actualizados: una base de conocimiento, archivos PDF, documentación interna, tickets, productos, manuales o contenido de una web.
El flujo suele ser así:
- Se dividen los documentos en fragmentos.
- Se generan embeddings de cada fragmento.
- Se guardan en una base vectorial.
- El usuario hace una pregunta.
- Se recuperan los fragmentos más relevantes.
- Esos fragmentos se agregan al prompt.
- El modelo genera una respuesta basada en ese contexto.
Usuario pregunta
↓
Búsqueda semántica con embeddings
↓
Documentos relevantes
↓
Prompt con contexto
↓
Modelo de IA genera la respuesta
RAG es especialmente útil cuando necesitás trabajar con información privada, específica o que cambia con frecuencia.
Por ejemplo, en lugar de entrenar un modelo desde cero cada vez que cambia la documentación de un producto, se puede indexar esa documentación y recuperarla en tiempo real al responder.
Fine-tuning: adaptar un modelo a una tarea
El fine-tuning es un proceso para ajustar un modelo previamente entrenado con ejemplos adicionales de una tarea, dominio o estilo específico.
Puede servir para:
- Clasificación de tickets.
- Extracción estructurada de datos.
- Respuestas con un formato muy consistente.
- Lenguaje propio de una empresa o industria.
- Estilos de redacción definidos.
- Casos de uso repetitivos a gran escala.
Sin embargo, no siempre es necesario. Para muchos proyectos, un buen prompt, ejemplos de entrada y salida, herramientas y un sistema RAG son suficientes.
Una regla práctica:
- Usá prompting cuando necesitás instrucciones claras y flexibles.
- Usá RAG cuando necesitás datos actuales, privados o verificables.
- Usá fine-tuning cuando necesitás comportamiento muy consistente y repetible en una tarea específica.
Alucinaciones: cuando la IA inventa información
Una alucinación ocurre cuando un modelo responde con información incorrecta, inventada o no verificable, pero presentada con seguridad.
Por ejemplo, una IA puede inventar:
- Una función que no existe en una librería.
- Una API o endpoint falso.
- Una cita que nunca fue publicada.
- Una característica de un producto inexistente.
- Datos, fechas o estadísticas incorrectas.
Esto sucede porque un modelo de lenguaje optimiza la generación de texto coherente, no la verificación automática de cada afirmación.
Para reducir el riesgo:
- Pedí fuentes y verificá las más importantes.
- Usá RAG con documentación confiable.
- Indicá que responda “no tengo suficiente información” cuando no pueda confirmar algo.
- Dividí problemas complejos en pasos verificables.
- Probá el código generado antes de incorporarlo a un proyecto.
- No compartas secretos, credenciales ni datos sensibles en prompts externos.
IA local vs. IA en la nube
Los modelos pueden ejecutarse mediante servicios en la nube o localmente en una computadora propia.
| Aspecto | IA en la nube | IA local |
|---|---|---|
| Potencia disponible | Alta, según el proveedor | Depende de CPU, RAM y GPU propias |
| Privacidad | Los datos se envían al proveedor | Los datos pueden permanecer en tu equipo |
| Costo | Pago por uso o suscripción | Inversión en hardware y consumo eléctrico |
| Facilidad de uso | Generalmente más simple | Requiere instalación y configuración |
| Modelos | Acceso a modelos cerrados y grandes | Principalmente modelos abiertos |
| Uso sin internet | Normalmente no | Sí, una vez descargado el modelo |
Para experimentar localmente existen herramientas como Ollama, llama.cpp y LM Studio. Son útiles para probar modelos abiertos, desarrollar prototipos, trabajar offline o mantener documentos sensibles dentro de una red local.
Buenas prácticas al usar IA
La IA es más útil cuando se la trata como una herramienta de asistencia, no como una fuente infalible.
- Definí claramente el objetivo antes de escribir el prompt.
- Aportá contexto real: audiencia, tecnologías, restricciones y formato esperado.
- Pedí resultados estructurados cuando los necesites: JSON, Markdown, tablas o tipos de TypeScript.
- Validá datos, enlaces, afirmaciones técnicas y código.
- Mantené información sensible fuera de servicios que no estén aprobados para manejarla.
- Usá documentación oficial como fuente principal en temas técnicos.
- Probá los resultados en escenarios reales.
- Iterá: un segundo prompt bien enfocado suele mejorar mucho el resultado inicial.
Conclusión
Entender conceptos como modelos, tokens, ventana de contexto, embeddings, RAG y alucinaciones permite usar la Inteligencia Artificial con expectativas más realistas.
La IA generativa puede acelerar tareas de escritura, investigación, diseño, programación y automatización. Pero sigue necesitando contexto, instrucciones claras y revisión humana.
El mejor resultado no aparece por escribir una pregunta mágica: aparece al combinar una buena herramienta, un modelo adecuado, datos confiables y criterio profesional.