

Inferock-bench es un proxy local que se sitúa entre tu aplicación y las llamadas con formato de OpenAI, Anthropic, Gemini u OpenRouter. Captura el uso de tokens por llamada, los fallos y los reintentos, y luego genera un recibo independiente que muestra cuánto te han facturado y cuánto estás pagando de más en realidad.
Loading comments…
Información del proyecto
Palabras clave del producto
Inferock Bench es un proxy de diagnóstico local que se sitúa entre tu aplicación y los proveedores de IA como OpenAI, Anthropic, Gemini u OpenRouter. Captura el uso de tokens por llamada, fallos y reintentos, y luego genera un recibo independiente que muestra lo que te facturaron y cuánto estás pagando de más en realidad. En lugar de confiar en los propios registros de facturación del proveedor, Inferock Bench te ofrece un rastro de auditoría neutral y por llamada que tú controlas.
Inferock Bench enruta tu tráfico API a través de un proxy localhost, capturando el uso informado por el proveedor, la evidencia de precios, los metadatos de solicitud/respuesta, el estado, el tiempo y las señales de reintento. Solo mide las llamadas que realmente ve, por lo que los datos se basan en tu tráfico real.
La herramienta genera recibos mediante el código de calificación @inferock/measure incluido y el Estándar Inferock. Cada recibo separa el gasto del proveedor, la pérdida de dinero limitada por factura, la pérdida de tiempo y la exposición a la verificación de facturas, para que no compares peras con manzanas.
Cada superficie se marca como watched-clean, signal o not-openable. Esto significa que las comprobaciones no abiertas son visibles en lugar de asumirse silenciosamente como limpias, ofreciéndote una imagen honesta de lo que se verificó y lo que no.
Tus claves de proveedor nunca se envían a Inferock mediante el benchmark local. El proxy solo las adjunta a las solicitudes del proveedor, y los recibos permanecen locales a menos que decidas compartirlos.
"Los proveedores no deberían poder calificar sus propias facturas."
Esa es la filosofía central aquí. Inferock Bench no solo registra llamadas: saca a la luz activamente fallos de entrega que afectan a tu factura, como salida facturada vacía, rechazos, truncamiento, discrepancias en el recuento de tokens, ID de solicitud duplicados y evidencia de riesgo de descuento por caché. También señala reintentos por fallo del proveedor, que a menudo se absorben silenciosamente en tus costes. La herramienta es honesta sobre sus límites: no puede auditar el tráfico que eludió el proxy, y no declara cada discrepancia como un sobrecargo. En su lugar, conserva la evidencia para que las preguntas sobre la integridad de la facturación puedan responderse con datos, no con suposiciones.
Estás gastando de forma significativa en APIs de IA y sospechas que tu factura no coincide con la realidad. Inferock Bench es especialmente útil si necesitas responder preguntas como "¿me facturaron una llamada API fallida?" o quieres medir el uso de tokens de Claude o GPT localmente. También es una buena opción si estás evaluando múltiples proveedores y quieres un criterio consistente e independiente para los patrones de coste y fallos. La herramienta es extensible por diseño, aunque hoy solo se miden cuatro planos de proveedores: OpenAI, Anthropic, API de desarrollador de Gemini y endpoints fijos de OpenRouter. Si te sientes cómodo con una configuración de proxy local y quieres transparencia de facturación que puedas verificar tú mismo, vale la pena echarle un vistazo.
Otras herramientas que podrías considerar
Octopoda es una capa de infraestructura de código abierto que otorga a los agentes de IA memoria persistente, detección automática de bucles y observabilidad completa. Los agentes olvidan todo entre sesiones. Octopoda soluciona esto con una API de recordar/recuperar que sobrevive a reinicios, fallos y despliegues. El sistema de detección de bucles monitorea 5 señales para detectar agentes atrapados repitiéndose antes de que consuman tu presupuesto de API, con una estimación de costos en tiempo real que muestra exactamente cuánto desperdicia cada bucle. Un panel integrado muestra la puntuación de salud de cada agente, un explorador de memoria con historial de versiones, un registro de auditoría que documenta cada decisión con su razonamiento, y una reproducción de línea de tiempo que te permite revisar paso a paso todo lo que hizo tu agente. Funciona con LangChain, CrewAI, AutoGen y OpenAI Agents SDK con integraciones de una sola línea. Se ejecuta localmente con SQLite o se conecta a la nube con una variable de entorno. Nivel gratuito, licencia MIT. 177 registros, 120 estrellas en GitHub, cero gasto en marketing.
GitHits permite a los agentes de codificación acceder al código de código abierto del que depende tu aplicación. Obtén ejemplos de implementación reales, navegación por el código fuente de las dependencias, inspección de paquetes y documentación. Los agentes pueden buscar y leer tu base de código. Pero no pueden buscar ni leer el código de código abierto del que depende tu aplicación. Ahí es donde empiezan a adivinar, reintentar y entrar en bucles. GitHits crea un índice consciente de la versión bajo demanda. Los agentes pueden buscar, navegar e inspeccionar el código detrás de sus dependencias. CLI: npx githits@latest init
tree-based navigation, semantic refactoring, codebase analysis, and language porting tools for coding agents supporting 163 grammars
Los agentes de IA pueden lanzarse rápidamente, pero sin el contexto adecuado del producto, a menudo operan a ciegas. Brief ofrece a los equipos de producto una fuente viva de verdad que captura decisiones, preserva la intención del producto y proporciona contexto relevante a humanos y agentes a través de chat, Slack, CLI y MCP. Mantiene la estrategia, las decisiones y la ejecución conectadas desde la visión hasta el impacto.
Creador
pixel_pilot
Alternativas
Loading comments…