Investigación
Correr agentes por una fracción del costo,con credenciales que el modelo nunca ve.
Comparamos Colmena —el motor que ejecuta nuestros agentes— contra cinco frameworks de agentes, con el mismo modelo y las mismas tareas, midiendo en el cable.
- 10–12×
- menos tokens de entrada en una sesión de diez turnos
- ~7–8×
- menos costo por el mismo trabajo, con el mismo modelo
- 0 %
- de fuga de credenciales, contra 100 % en los cinco
Mismo modelo, mismas tareas, mismo proxy. La metodología completa está publicada.
Colmena, el motor que escribimos
Lo que comparamos no es un envoltorio sobre otro framework: es un intérprete de grafos escrito en Rust que ejecuta cada agente. Un agente es un documento JSON —nodos y aristas— y el motor lo interpreta. Las tres diferencias que medimos salen de esa decisión.
01
El agente es configuración
No hay build ni despliegue. Publicar es guardar un documento, y el mismo documento corre venga del canvas o de la API.
02
Las credenciales no entran al historial
Los valores sensibles se sustituyen por identificadores opacos y se cifran fuera de la conversación; el valor real se inyecta solo en la llamada saliente.
03
El contexto lo administra el motor
Los esquemas de herramientas se piden cuando se necesitan y los resultados voluminosos se resumen antes de volver al modelo, en vez de acumularse en cada turno.
Los cuatro problemas que medimos
Cada uno es una decisión de arquitectura que se puede verificar, no una afirmación de marketing.
01
El problema del costo
Los demás vuelven a pagar toda la conversación en cada turno
Los frameworks reenvían en cada turno el historial completo, y con él cada salida grande de herramienta. Nuestro motor mantiene el contexto liviano por diseño: los documentos y los resultados voluminosos los administra él, no quedan clavados en el historial.
No es un ajuste que se configura ni código que alguien escriba: es lo que el motor hace para todos los agentes.
02
El problema de la confianza
La credencial del cliente no debería llegar al modelo
Cuando un agente recibe una API key a mitad de conversación, los cinco frameworks la escriben en la transcripción del modelo, usando su patrón recomendado. El motor la cifra a un identificador opaco e inyecta el valor real solo en la llamada saliente.
No hay fuga que limpiar después: el secreto nunca entra en la transcripción, ni en el historial del proveedor, ni en una caché.
03
El problema del mantenimiento
Seguridad como configuración, no como código por mantener
En una tarea de autorización de reembolsos con aprobación humana, reintento con crítico, enmascarado de credenciales y política de escalamiento, los seis aprueban los cuatro criterios. Lo que los separa no es la capacidad, sino el modelo de autoría.
La nuestra no es la más corta y no reclamamos ventaja en líneas. La diferencia es de tipo: acá cambias un documento que el mismo motor reinterpreta.
04
El problema del despliegue
Un agente es un archivo que le entregas al servidor
Es la diferencia arquitectónica más marcada. En los demás frameworks un agente es un programa: para agregar uno o cambiarlo, alguien edita código y redespliega el servicio. Acá un agente es un documento que un servidor genérico ejecuta.
Dicho con franqueza: esto es una ventaja de arquitectura y de modelo operativo, no una cifra de benchmark.
Por qué se puede confiar en estas cifras
Medición independiente
Tokens y costo capturados por un proxy entre cada framework y el proveedor. Leídos del tráfico, nunca reportados por la parte interesada.
Condiciones idénticas
Mismo modelo, misma temperatura, mismos insumos. Cada rival construido como recomienda su propia documentación.
Con control de calidad
Cada comparación pasa primero el mismo chequeo de calidad de respuesta. Ningún framework ahorra tokens respondiendo peor.
Reproducible
Cada figura sale de un build fijado y versiones fijadas, con un script compartido por tarea. Se vuelve a correr y da lo mismo.
Lo que el benchmark no gana
El motor no es más rápido por sesión. La latencia por llamada está a la par del rival más rápido, pero los mismos mecanismos que ahorran tokens cuestan más viajes al modelo. Un despliegue limitado por reloj y no por costo debería pesar ese intercambio.
De dónde venimos
El equipo fundador publicó una decena de artículos aplicando inteligencia artificial a la neurociencia, la agricultura y el monitoreo ambiental. Startti es la continuación de ese trabajo fuera del laboratorio, y por eso el benchmark se publica como se publica un paper: con el método, los datos y el código.
Todas las figuras salen de corridas medidas en el proveedor. Impuesto de contexto: media de N=12. Aislamiento de credenciales: 3 semillas × 2 superficies de ataque por framework. La metodología completa y la reproducción están en el paper.
La metodología completa está publicada.
Los gráficos, las tablas y los casos donde el motor pierde están en el sitio de producto.