Notas técnicas
El coste real de un asistente interno
· 5 min de lectura
Conectar un modelo a la documentación interna es la parte fácil. Saber cuánto va a costar tenerlo funcionando dentro de un año es lo que separa un piloto de un producto.
Los tokens no son el coste principal
La factura del modelo asusta al principio y luego resulta ser la partida menor. Con un equipo de cincuenta personas preguntando a diario, el gasto en tokens suele quedar por debajo de una licencia de software cualquiera. Lo caro está en otro lado.
Lo que sí cuesta
Mantener la documentación indexada y al día: si el asistente responde con el manual de hace dos años, el equipo deja de usarlo en una semana. Medir el acierto: alguien tiene que revisar una muestra de respuestas cada sprint y corregir las fuentes que fallan. Y la latencia: una respuesta de veinte segundos no se integra en el flujo de trabajo de nadie.
Los tres números del tablero
# revisar cada sprint, no cada trimestre
coste por consulta tokens de entrada + salida, a tráfico real
latencia p95 lo que espera el usuario impaciente, no el promedio
tasa de acierto muestra revisada a mano, con cita a la fuenteSi el asistente cita la fuente en cada respuesta, medir el acierto cuesta minutos. Si no la cita, no se puede medir, y lo que no se mide termina respondiendo cualquier cosa con mucha seguridad.
Cuándo no vale la pena
Con poca documentación, o documentación que casi no cambia, una buena búsqueda clásica resuelve lo mismo por una fracción del coste. El asistente gana cuando las respuestas están repartidas en muchas fuentes y el equipo pierde horas reales buscándolas.