¿Qué modelo de IA para cada tarea? Una asignación por pasos de trabajo

La pregunta por el mejor modelo despista, porque presupone una clasificación. Más útil es la asignación por paso de trabajo: en qué tarea importa la exactitud, en cuál la actualidad, en cuál la extensión.

Cuatro cuerpos luminosos de formas distintas encajan con precisión en sus respectivos huecos

Lo esencial

  • No decide el modelo sino qué propiedad exige la tarea: exactitud, actualidad, extensión, velocidad o coste.
  • Cinco propiedades cubren el día a día del marketing; quien las conoce puede situar por sí mismo cualquier generación nueva de modelos.
  • A la mayoría de las empresas pequeñas les bastan dos modelos: uno para el trabajo largo y exacto, otro para las tareas rápidas y masivas.
  • Cambiar de modelo cuesta tiempo, sobre todo porque hay que volver a ajustar las instrucciones y las plantillas.

Los modelos envejecen más rápido que cualquier comparación. Lo que no envejece es la pregunta de qué propiedad exige una tarea, y esa asignación sobrevive a cualquier generación.

Las cinco propiedades

1. Exactitud con instrucciones largas

¿Con qué fiabilidad se respetan diez reglas numeradas, incluidas las que están en medio? Decisiva en las tareas de revisión y allí donde deba respetarse un marco de estilo.

2. Acceso a lo actual

¿Puede el modelo buscar, y con qué acierto elige las fuentes? Decisiva en la investigación, la observación de la competencia y todo lo ocurrido después del corte de entrenamiento.

3. Extensión procesable

¿Cuánto texto se puede tener en cuenta de una vez, y con qué atención se sigue tratando el principio cuando hay mucho detrás? Decisiva al revisar documentos enteros.

4. Velocidad y coste

En las tareas masivas —cien textos de producto, cincuenta traducciones— la velocidad y el precio determinan si una tarea tiene sentido siquiera.

5. Uso de herramientas

¿Con qué fiabilidad se emplean realmente las herramientas conectadas en lugar de adivinar? Decisiva en cuanto hay conexiones a sistemas propios en juego.

Asignación por paso de trabajo

Paso de trabajoPropiedad más importanteQué sale mal si falta
Investigación de preguntas actualesactualidaddatos obsoletos, formulados de forma convincente
Versión en bruto de un artículoexactitud con instruccionesse ignora el marco de estilo, caen reglas
Revisión de un documento largoextensiónla primera mitad se revisa por encima
Traducción a muchos idiomasvelocidad y costela tarea deja de ser rentable
Trabajo con sistemas conectadosuso de herramientaslas respuestas se adivinan en vez de consultarse
Acortar y reformularninguna en especial
Reunir ideas y variantesninguna en especial

Las dos últimas filas son más importantes de lo que parecen: para una parte considerable de las tareas diarias, la elección de modelo es sencillamente indiferente. Quien invierta ahí tiempo en elegir está optimizando el punto equivocado.

¿Sabías que…?

El motivo más frecuente de un mal resultado no es el modelo sino una instrucción que contiene demasiadas cosas importantes en medio. Los datos del principio y del final de un prompt se tienen en cuenta con más fiabilidad que los intermedios, en todos los modelos habituales.

Así que quien tenga la impresión de que un modelo «no se atiene a las indicaciones» debería primero mover la regla central al final. En la práctica eso surte efecto más veces que cambiar a un modelo mayor, y no cuesta nada.

Por qué dos modelos suelen bastar

Para las empresas pequeñas, el reparto practicable es abarcable:

  1. Un modelo potente para el trabajo que importa. Versiones en bruto, revisiones, todo lo que lleve instrucciones largas y textos largos. Aquí compensa el precio mayor, porque la alternativa es rehacer.
  2. Un modelo rápido y barato para la masa. Traducciones, resúmenes, reformulaciones, clasificaciones. Aquí cuenta el rendimiento.

Un tercer modelo solo compensa cuando una tarea exige una propiedad que los dos primeros no tienen, por ejemplo una extensión procesable especialmente grande.

Desde la práctica

Cambiar de proveedor cuesta más de lo que hace suponer la comparación. No el manejo: eso se parece. Sino los marcos ajustados: documento de estilo, instrucciones guardadas, plantillas, conexiones, formulaciones habituales.

En la práctica pasan dos o tres semanas hasta que un entorno nuevo entrega la misma calidad que el rodado. Un modelo tiene que ser claramente mejor, no un poco, para que el cambio salga a cuenta, y «claramente mejor» solo se determina con la propia tarea, no con una clasificación.

Cómo se comprueba con la propia tarea

Las clasificaciones miden tareas estandarizadas. Vuestra tarea no es una de ellas. Una comparación propia aprovechable necesita cuatro cosas:

  • Tres tareas reales del día a día, no preguntas de prueba. Mejor aquellas cuyo buen resultado ya conocéis.
  • El mismo prompt, palabra por palabra. Si no, comparáis formulaciones en lugar de modelos.
  • Una valoración fija. Determinar de antemano en qué reconocéis «mejor»: por ejemplo, reglas respetadas, ningún dato inventado, extensión acertada.
  • Dos rondas por modelo. La dispersión entre dos respuestas del mismo modelo suele ser mayor que la diferencia entre dos modelos.
Prompt
Ayúdame a determinar la elección de modelo adecuada para nuestros
pasos de trabajo. No recomiendes proveedores: ordena por
propiedades.

Nuestras tareas:
[lista de tareas recurrentes, una por línea, con la frecuencia
aproximada al mes]

Nuestras condiciones:
- Presupuesto para herramientas de IA al mes: [importe]
- ¿Hay datos personales en juego? [sí / no / en parte]
- ¿Tenemos conexiones a sistemas propios? [sí / no]
- ¿Trabajamos en varios idiomas? [idiomas]

Tareas:
1. Asigna cada una de nuestras tareas a exactamente una
   propiedad principal: exactitud con instrucciones largas /
   actualidad / extensión procesable / velocidad y coste / uso
   de herramientas / ninguna en especial.
2. Nombra las tareas en las que la elección de modelo es
   indiferente: son aquellas en las que no deberíamos invertir
   tiempo.
3. Dime si dos modelos nos bastan y para qué cada uno.
4. Diseña una comparación propia: tres tareas reales de mi
   lista, una valoración fija, cuántas rondas.

No nombres modelos concretos ni clasificaciones.

Conclusión

La pregunta útil no es «qué modelo es el mejor», sino «qué propiedad exige esta tarea». Cinco propiedades cubren el día a día del marketing, y para buena parte de las tareas la respuesta es: ninguna en especial.

Dos modelos —uno para el trabajo exigente, otro para la masa— bastan a la mayoría de las empresas pequeñas. Y antes de cambiar compensa el intento más barato: poner la regla central al final del prompt.

Preguntas frecuentes

¿Qué modelo de IA sirve para cada tarea?

Depende de la propiedad exigida: la investigación de preguntas actuales necesita acceso a la búsqueda web; las versiones en bruto y las revisiones necesitan exactitud con instrucciones largas; revisar documentos enteros necesita una gran extensión procesable; las traducciones a muchos idiomas necesitan velocidad y bajo coste; y el trabajo con sistemas conectados necesita un uso fiable de las herramientas.

¿Cuántos modelos distintos necesita una empresa pequeña?

Dos suelen bastar: uno potente para versiones en bruto, revisiones e instrucciones largas, y otro rápido y barato para la masa: traducciones, resúmenes, clasificaciones. Un tercero solo compensa cuando una tarea exige una propiedad que ninguno de los dos cubre.

¿Por qué no se atiene el modelo a mis indicaciones?

A menudo no es cosa del modelo sino de la posición de la instrucción. Los datos del principio y del final de un prompt se tienen en cuenta con más fiabilidad que los intermedios. Mover la regla central al final surte efecto en la práctica más veces que cambiar a un modelo mayor.

¿Compensa cambiar a un modelo nuevo?

Solo si es claramente mejor, no un poco. El cambio cuesta dos o tres semanas hasta que el documento de estilo, las instrucciones guardadas, las plantillas y las conexiones vuelven a estar rodados. Si «claramente mejor» se cumple lo muestra únicamente una comparación con las propias tareas, no una clasificación general.

¿Cómo se comparan modelos con la propia tarea?

Con tres tareas reales del día a día en lugar de preguntas de prueba, el mismo prompt palabra por palabra, una valoración fijada de antemano —por ejemplo: reglas respetadas, ningún dato inventado, extensión acertada— y dos rondas por modelo. La segunda ronda es importante: la dispersión dentro de un modelo suele ser mayor que la diferencia entre dos.

Marketing que se configura solo

La beta del Studio Engine está abierta. Reserva tu plaza y participa desde el principio.

Unirse a la beta →
← Volver al listado