Saltar al contenido
LatentedigitalEntender la IA. Usarla mejor.
TutorialIntermedio· 15 min· Probado el 10 de sept de 2026

Probar un modelo de IA local antes de darle trabajo de verdad

Cuatro tareas de un minuto que te dicen si un modelo sirve para lo tuyo. Las corrimos en tres modelos de tamaños muy distintos y los tres fallaron exactamente la misma.

Asistido por IA

Resultado esperado

Una tabla propia con cuatro tareas, la respuesta correcta de cada una y el resultado de cada modelo que pruebes. Con eso podés decidir con datos cuál usar, y —más importante— qué cosas no delegarle a ninguno.

Necesitás

  • Ollama instalado y al menos dos modelos descargados, para poder comparar
  • Cuatro tareas sacadas de tu trabajo real, no de un ejemplo de manual
  • La respuesta correcta de cada tarea, decidida antes de correr nada
  • Unos 15 minutos: el banco entero, en los tres modelos, nos llevó 37 segundos de cómputo

Elegir un modelo local se parece a elegir una herramienta a ojo. Las listas de comparación miden cosas que no son tu trabajo, y el tamaño —3B, 7B, 14B— sugiere una jerarquía que no siempre se cumple.

La alternativa es medir. No hace falta un banco de pruebas profesional: con cuatro tareas cortas que representen lo que realmente vas a pedirle, y una respuesta correcta conocida de antemano, en quince minutos sabés si un modelo te sirve.

Armamos esas cuatro tareas y las corrimos en tres modelos: llama3.2:3b, qwen2.5:7b y qwen2.5:14b. Los tres sacaron el mismo puntaje. Y los tres fallaron exactamente la misma tarea, que es el resultado más útil de todos.

Elegí cuatro tareas que se puedan corregir solas

La regla que hace útil a este banco: cada tarea tiene que tener una respuesta que puedas dar por buena o mala sin discutir. Si para saber si estuvo bien tenés que interpretar, no sirve como prueba.

Las cuatro que usamos, y qué mide cada una:

  1. Extraer un dato exacto. Le das un texto con un teléfono adentro y pedís solo el número. Mide si sabe encontrar y no adornar.
  2. Respetar una palabra prohibida. Pedís una frase publicitaria y prohibís una palabra concreta. Mide si obedece una restricción negativa, que es lo que más les cuesta.
  3. Hacer una cuenta con contexto. Tres kilos a un precio, dos docenas a otro, total. Mide aritmética con datos envueltos en una frase.
  4. Devolver solo el formato pedido. Tres líneas que empiecen con guion, nada antes ni después. Mide si puede callarse.

Escribí la respuesta correcta antes de correr nada

Esto no es una formalidad. Si mirás la respuesta del modelo y después decidís si está bien, vas a ser generoso: las salidas suenan convincentes y uno tiende a darlas por buenas.

En nuestro caso: el teléfono era 11 5542 8890; la palabra prohibida no podía aparecer; el total era 22.800 —tres kilos a 2.400 más dos docenas a 7.800—; y el formato eran tres líneas empezadas con guion, ni una más.

Anotá las cuatro respuestas en un papel antes de abrir nada.

Corré las cuatro tareas en cada modelo

Con Ollama alcanza con pegar cada tarea:

ollama run llama3.2:3b

y después repetir con el siguiente modelo. Importa una sola cosa: el mismo texto exacto en todos. Si le cambiás una coma a uno, la comparación se cae.

Anotá también cuánto tardó cada respuesta. Ese número va a pesar en la decisión final más de lo que suponés.

Compará y mirá dónde coinciden los errores

Esto es lo que nos dio, con temperatura en cero para que sea reproducible:

  • llama3.2:3b (2,0 GB) — 3 de 4. Extrajo el teléfono en 2,5 s, respetó la palabra prohibida, cumplió el formato. Falló la cuenta: dijo 7.560.
  • qwen2.5:7b (4,7 GB) — 3 de 4. Lo mismo, con la respuesta más limpia de las tres en la tarea de formato. Falló la cuenta: dijo 8.280.
  • qwen2.5:14b (9,0 GB) — 3 de 4. Igual. Falló la cuenta: dijo 17.400.

El total era 22.800. Ninguno se acercó. Duplicar el tamaño del modelo dos veces seguidas —de 3B a 7B a 14B— no arregló una multiplicación de dos términos con una suma.

Mirá el tiempo, no solo los aciertos

Los tres empataron en puntaje, así que el desempate está en otro lado.

En la tarea de extraer el teléfono: 2,5 segundos el de 3B, 5,2 el de 7B y 17,2 el de 14B. Casi siete veces más lento para dar exactamente la misma respuesta correcta.

Si tu tarea es extraer datos de textos cortos, el modelo grande te cuesta 9 GB de disco y siete veces el tiempo, y no te devuelve nada mejor. Ese es el tipo de decisión que un banco de pruebas te deja tomar con números en vez de con intuición.

Donde sí pesó el tamaño fue en el seguimiento de instrucciones largas: probando otros textos más complejos, el de 14B respetó estructuras que los otros dos rompían. Depende de la tarea, y por eso la tarea tiene que ser la tuya.

Decidí, y anotá qué no vas a delegar

El banco no termina eligiendo un modelo. Termina con dos listas.

Lo que este modelo puede hacer: las tareas que aprobó. Con eso trabajás tranquilo.

Lo que no le vas a pedir a ninguno: las tareas que fallaron todos. En nuestro caso, cualquier cosa con plata. No es una limitación del modelo que elegiste: es una limitación de la categoría, y el remedio no es cambiar de modelo sino conectar una herramienta que haga la cuenta, o hacerla vos.

Guardá la tabla. Cuando salga el modelo de moda del mes, corrés las mismas cuatro tareas y en dos minutos sabés si te conviene cambiar, en vez de creerle al anuncio.

Errores comunes

Todas las respuestas te parecen buenas

Casi seguro decidiste el criterio después de leerlas. Escribí la respuesta correcta antes de correr el modelo, y compará contra ese papel. Es la diferencia entre medir y opinar.

Comparás modelos con prompts distintos

Si a uno le pusiste un ejemplo y al otro no, no estás comparando modelos: estás comparando prompts. Copiá y pegá el mismo texto exacto en todos, y fijá la temperatura en cero para que la corrida se pueda repetir.

Elegís el modelo más grande porque sí

En nuestro banco los tres sacaron el mismo puntaje y el más grande tardó siete veces más en la tarea de extracción. El tamaño ayuda en instrucciones complejas y no ayuda en nada en aritmética. Sin medir, estás pagando disco y tiempo por una mejora que quizás no exista en tu caso.

Un modelo aprueba la tarea de formato pero la respuesta es rara

Nos pasó: llama3.2:3b devolvió las tres líneas con guion, pero cada una traía una descripción larga que nadie había pedido. Cumplía la regla que yo había escrito, no la que tenía en la cabeza. Si el criterio es ambiguo, la culpa es del criterio: afinalo y volvé a correr.

El banco te da resultados distintos cada vez

Poné la temperatura en cero. Sin eso el modelo varía entre corridas y no podés atribuir una diferencia al modelo en vez de al azar.

Preguntas frecuentes

¿Por qué cuatro tareas y no un banco de pruebas serio?
Porque los bancos serios miden un promedio de tareas que no son las tuyas, y porque uno que lleva una tarde no lo vas a repetir. Cuatro tareas sacadas de tu trabajo real te dicen más sobre tu caso que un ranking general, y las repetís cada vez que aparece un modelo nuevo.
¿Los resultados de ustedes valen para mí?
El método sí; los números no necesariamente. Medimos cuatro tareas concretas, en español, con temperatura cero, en una computadora con chip M4. Otro equipo da otros tiempos, y otras tareas dan otros aciertos. Lo único que sí generalizaríamos es el fallo aritmético: se repitió idéntico en los tres tamaños.
¿Entonces los modelos locales no sirven para cuentas?
Para cuentas de las que dependa una decisión, no les creas sin verificar. En nuestras pruebas fallaron los tres, con errores muy distintos entre sí, que es lo peor: si todos se equivocaran igual, al menos sería detectable. Si necesitás aritmética confiable, dásela a una calculadora.
¿Sirve el mismo método para modelos que no son locales?
Sí, el método es el mismo: mismas tareas, misma corrección, respuesta escrita de antemano. No lo probamos con modelos de pago, así que no te vamos a dar números de esos.
¿Cuánto ocupa todo esto en disco?
Los tres modelos que usamos suman unos 15,7 GB: 2,0 el de 3B, 4,7 el de 7B y 9,0 el de 14B. Se pueden borrar cuando terminás de medir y quedarte solo con el que elegiste.
¿Puedo automatizar el banco?
Nosotros lo corrimos con un script contra la API local de Ollama, en el puerto 11434, para poder cronometrar y corregir sin intervención. Pero no hace falta: pegando las cuatro tareas a mano en la terminal llegás al mismo resultado, que es el que importa.
CompartirXLinkedInWhatsApp

Relacionados