Probar un modelo de IA local antes de darle trabajo de verdad
Cuatro tareas de un minuto que te dicen si un modelo sirve para lo tuyo. Las corrimos en tres modelos de tamaños muy distintos y los tres fallaron exactamente la misma.
CEO
Resultado esperado
Una tabla propia con cuatro tareas, la respuesta correcta de cada una y el resultado de cada modelo que pruebes. Con eso podés decidir con datos cuál usar, y —más importante— qué cosas no delegarle a ninguno.
Necesitás
- Ollama instalado y al menos dos modelos descargados, para poder comparar
- Cuatro tareas sacadas de tu trabajo real, no de un ejemplo de manual
- La respuesta correcta de cada tarea, decidida antes de correr nada
- Unos 15 minutos: el banco entero, en los tres modelos, nos llevó 37 segundos de cómputo
Elegir un modelo local se parece a elegir una herramienta a ojo. Las listas de comparación miden cosas que no son tu trabajo, y el tamaño —3B, 7B, 14B— sugiere una jerarquía que no siempre se cumple.
La alternativa es medir. No hace falta un banco de pruebas profesional: con cuatro tareas cortas que representen lo que realmente vas a pedirle, y una respuesta correcta conocida de antemano, en quince minutos sabés si un modelo te sirve.
Armamos esas cuatro tareas y las corrimos en tres modelos: llama3.2:3b, qwen2.5:7b y qwen2.5:14b. Los tres sacaron el mismo puntaje. Y los tres fallaron exactamente la misma tarea, que es el resultado más útil de todos.
Elegí cuatro tareas que se puedan corregir solas
La regla que hace útil a este banco: cada tarea tiene que tener una respuesta que puedas dar por buena o mala sin discutir. Si para saber si estuvo bien tenés que interpretar, no sirve como prueba.
Las cuatro que usamos, y qué mide cada una:
- Extraer un dato exacto. Le das un texto con un teléfono adentro y pedís solo el número. Mide si sabe encontrar y no adornar.
- Respetar una palabra prohibida. Pedís una frase publicitaria y prohibís una palabra concreta. Mide si obedece una restricción negativa, que es lo que más les cuesta.
- Hacer una cuenta con contexto. Tres kilos a un precio, dos docenas a otro, total. Mide aritmética con datos envueltos en una frase.
- Devolver solo el formato pedido. Tres líneas que empiecen con guion, nada antes ni después. Mide si puede callarse.
Escribí la respuesta correcta antes de correr nada
Esto no es una formalidad. Si mirás la respuesta del modelo y después decidís si está bien, vas a ser generoso: las salidas suenan convincentes y uno tiende a darlas por buenas.
En nuestro caso: el teléfono era 11 5542 8890; la palabra prohibida no podía aparecer; el total era 22.800 —tres kilos a 2.400 más dos docenas a 7.800—; y el formato eran tres líneas empezadas con guion, ni una más.
Anotá las cuatro respuestas en un papel antes de abrir nada.
Corré las cuatro tareas en cada modelo
Con Ollama alcanza con pegar cada tarea:
ollama run llama3.2:3b
y después repetir con el siguiente modelo. Importa una sola cosa: el mismo texto exacto en todos. Si le cambiás una coma a uno, la comparación se cae.
Anotá también cuánto tardó cada respuesta. Ese número va a pesar en la decisión final más de lo que suponés.
Compará y mirá dónde coinciden los errores
Esto es lo que nos dio, con temperatura en cero para que sea reproducible:
- llama3.2:3b (2,0 GB) — 3 de 4. Extrajo el teléfono en 2,5 s, respetó la palabra prohibida, cumplió el formato. Falló la cuenta: dijo 7.560.
- qwen2.5:7b (4,7 GB) — 3 de 4. Lo mismo, con la respuesta más limpia de las tres en la tarea de formato. Falló la cuenta: dijo 8.280.
- qwen2.5:14b (9,0 GB) — 3 de 4. Igual. Falló la cuenta: dijo 17.400.
El total era 22.800. Ninguno se acercó. Duplicar el tamaño del modelo dos veces seguidas —de 3B a 7B a 14B— no arregló una multiplicación de dos términos con una suma.
Mirá el tiempo, no solo los aciertos
Los tres empataron en puntaje, así que el desempate está en otro lado.
En la tarea de extraer el teléfono: 2,5 segundos el de 3B, 5,2 el de 7B y 17,2 el de 14B. Casi siete veces más lento para dar exactamente la misma respuesta correcta.
Si tu tarea es extraer datos de textos cortos, el modelo grande te cuesta 9 GB de disco y siete veces el tiempo, y no te devuelve nada mejor. Ese es el tipo de decisión que un banco de pruebas te deja tomar con números en vez de con intuición.
Donde sí pesó el tamaño fue en el seguimiento de instrucciones largas: probando otros textos más complejos, el de 14B respetó estructuras que los otros dos rompían. Depende de la tarea, y por eso la tarea tiene que ser la tuya.
Decidí, y anotá qué no vas a delegar
El banco no termina eligiendo un modelo. Termina con dos listas.
Lo que este modelo puede hacer: las tareas que aprobó. Con eso trabajás tranquilo.
Lo que no le vas a pedir a ninguno: las tareas que fallaron todos. En nuestro caso, cualquier cosa con plata. No es una limitación del modelo que elegiste: es una limitación de la categoría, y el remedio no es cambiar de modelo sino conectar una herramienta que haga la cuenta, o hacerla vos.
Guardá la tabla. Cuando salga el modelo de moda del mes, corrés las mismas cuatro tareas y en dos minutos sabés si te conviene cambiar, en vez de creerle al anuncio.
Errores comunes
Todas las respuestas te parecen buenas
Casi seguro decidiste el criterio después de leerlas. Escribí la respuesta correcta antes de correr el modelo, y compará contra ese papel. Es la diferencia entre medir y opinar.
Comparás modelos con prompts distintos
Si a uno le pusiste un ejemplo y al otro no, no estás comparando modelos: estás comparando prompts. Copiá y pegá el mismo texto exacto en todos, y fijá la temperatura en cero para que la corrida se pueda repetir.
Elegís el modelo más grande porque sí
En nuestro banco los tres sacaron el mismo puntaje y el más grande tardó siete veces más en la tarea de extracción. El tamaño ayuda en instrucciones complejas y no ayuda en nada en aritmética. Sin medir, estás pagando disco y tiempo por una mejora que quizás no exista en tu caso.
Un modelo aprueba la tarea de formato pero la respuesta es rara
Nos pasó: llama3.2:3b devolvió las tres líneas con guion, pero cada una traía una descripción larga que nadie había pedido. Cumplía la regla que yo había escrito, no la que tenía en la cabeza. Si el criterio es ambiguo, la culpa es del criterio: afinalo y volvé a correr.
El banco te da resultados distintos cada vez
Poné la temperatura en cero. Sin eso el modelo varía entre corridas y no podés atribuir una diferencia al modelo en vez de al azar.