viernes, 11 de septiembre de 2026

Rethinking Enterprise Testing for Agentic AI

The emergence of agentic AI represents a fundamental shift in software architecture that renders traditional testing methodologies obsolete. Unlike deterministic software, where specific inputs yield predictable outputs, agentic AI operates with a degree of autonomy and non-deterministic decision-making. These systems function as dynamic loops that perceive their environment, reason through complex tasks, and execute multi-step workflows, creating a testing surface that is exponentially more variable and harder to validate than standard monolithic or microservices applications.

Why agentic AI requires a new approach to enterprise software testing - IT Pro
Imagen generada con IA

For enterprise software engineers, this evolution demands a transition from static test scripts to continuous, behavior-based evaluation frameworks. Traditional unit and integration tests are insufficient when the system’s logic evolves based on context and external feedback loops. Instead, organizations must implement robust guardrails and observability platforms that monitor agent performance in real-time. This includes measuring the reliability of reasoning chains, verifying the safety of external tool execution, and assessing the semantic accuracy of autonomous outcomes. Testing can no longer be viewed as a final pre-deployment phase; it must be embedded directly into the agent’s lifecycle to manage the inherent risks of drift and hallucination.

The core challenge lies in the unpredictable nature of how agents might interpret instructions or navigate unforeseen edge cases in production. To mitigate these risks, enterprises are moving toward sandbox-based simulations where agents are subjected to high-fidelity environments that mirror their operational reality. By using synthetic data and adversarial stress testing, engineers can identify vulnerabilities in an agent’s decision-making process before it is granted access to sensitive enterprise systems. This shift requires a cultural move toward rigorous monitoring, where the focus moves from confirming code functionality to ensuring the safety, ethical alignment, and task accuracy of the agentic workflow.

Ultimately, the move toward agentic AI necessitates a unified strategy for automated quality assurance. Developers must treat agents as evolving personas that require ongoing supervision rather than set-and-forget software components. As these autonomous tools become integral to enterprise automation, the ability to validate non-deterministic outcomes through automated evaluation pipelines will determine the success and scalability of AI-driven transformation within the modern stack.

Artículos relacionados de LaRebelión:


Fuente Original: IT Pro

Artículo generado mediante AI.larebelion.

Zuckerberg advierte sobre los peligros de centralizar la IA

Mark Zuckerberg ha expresado una postura crítica respecto a la política de exclusividad que mantienen ciertos laboratorios de inteligencia artificial al restringir el acceso a sus modelos más avanzados. Durante una entrevista reciente, el CEO de Meta subrayó que considerar la retención de estos sistemas como una medida de seguridad es una estrategia errónea y potencialmente peligrosa. Según su perspectiva, el riesgo real para la sociedad no reside en la democratización del acceso a estas tecnologías, sino en la concentración del poder tecnológico en manos de unas pocas entidades privadas.

Zuckerberg tells Sources labs holding back AI models is ‘quite dangerous’

La preocupación de Zuckerberg radica en el desequilibrio que se genera cuando un pequeño grupo de investigadores o corporaciones posee el control absoluto sobre herramientas con capacidades superiores. Al limitar el despliegue de modelos de inteligencia artificial, estos laboratorios actúan como guardianes de una innovación que debería ser accesible para una comunidad técnica más amplia. Para él, esta centralización crea puntos únicos de falla y vulnerabilidad, donde la toma de decisiones sobre el uso y la seguridad de la tecnología queda aislada del escrutinio público y de la colaboración abierta que caracteriza al desarrollo de software robusto.

Este pronunciamiento ocurre en un momento estratégico para Meta, que ha buscado posicionarse como un defensor del desarrollo de código abierto dentro del ecosistema de la inteligencia artificial. A medida que la industria debate sobre los protocolos de seguridad necesarios para evitar resultados catastróficos, el argumento de Zuckerberg traslada el foco desde la prevención basada en el secreto hacia una estrategia de resiliencia basada en la transparencia y la distribución. La postura sugiere que la mejor manera de mitigar los riesgos asociados con la IA no es limitando quién puede acceder a ella, sino fomentando un entorno donde múltiples actores puedan auditar, mejorar y entender el funcionamiento de los modelos a medida que estos evolucionan.

Para la comunidad técnica, este debate subraya una fractura ideológica creciente dentro de Silicon Valley. Mientras algunos sectores abogan por un control férreo bajo la premisa de la seguridad existencial, el enfoque de Meta sugiere que el hermetismo podría ser, irónicamente, el camino más rápido hacia un escenario donde una tecnología transformadora sea controlada sin supervisión suficiente. La controversia pone de relieve la tensión inminente sobre cómo se definirán los estándares de gobernanza y accesibilidad para la próxima generación de sistemas inteligentes.

Artículos relacionados de LaRebelión:


Fuente Original: thenextweb.com

Artículo generado mediante AI.larebelion.

El futuro del pentesting con agentes autónomos

La integración de la inteligencia artificial en el pentesting ha dejado de ser una promesa teórica para convertirse en una realidad operativa. A través del desarrollo de FaradAI, los ingenieros de FaradaySec han explorado los límites de la automatización ofensiva, concluyendo que la verdadera ventaja competitiva no reside simplemente en la capacidad de los modelos de lenguaje para generar texto, sino en la creación de sistemas robustos basados en la evidencia, la trazabilidad y una gobernanza estricta. El objetivo no es reemplazar al profesional humano, sino establecer una colaboración simbiótica donde la máquina aporte escala y el experto proporcione el contexto crítico necesario para la toma de decisiones.

Cómo gestionar el "Autonomous Continuous Attack" con Agentes IA en Offensive Security

Uno de los hallazgos fundamentales de esta investigación es la distinción entre un agente que genera respuestas plausibles y uno capaz de ejecutar acciones verificables. Mientras que un LLM puede proponer técnicas ofensivas basándose en su entrenamiento, un sistema de pentesting autónomo requiere un ciclo de vida complejo: definición del objetivo, toma de decisiones, ejecución mediante herramientas reales como Metasploit o Burp, y captura de pruebas irrefutables. La automatización efectiva permite reducir drásticamente los costos de repetición, facilitando que el análisis de seguridad sea continuo en lugar de episódico. Sin embargo, esto introduce el desafío de la gobernanza, ya que sin límites predefinidos sobre el alcance, el tiempo o el presupuesto, los agentes tienden a caer en bucles repetitivos y poco productivos.

La experiencia técnica acumulada ha permitido identificar que el contexto es la variable que más influye en el éxito de estos agentes. Un modelo sin información sobre el entorno, la criticidad de los activos o el historial de vulnerabilidades de la empresa, simplemente dispersa sus esfuerzos. Por el contrario, al integrar metadatos de negocio, el agente puede priorizar sus hallazgos de manera mucho más inteligente. Especialmente en tareas de triage de vulnerabilidades, donde el volumen de información suele ser abrumador, la IA demuestra un retorno de inversión inmediato al reducir el ruido antes de que los resultados lleguen a los equipos humanos.

Finalmente, el mayor desafío detectado es la brecha de confianza. Existe una diferencia significativa entre la capacidad de un agente para detectar una vulnerabilidad y su capacidad para probarla sin errores. Los falsos positivos sintéticos pueden parecer extremadamente convincentes, por lo que es vital que cada hallazgo esté respaldado por un registro detallado y reproducible. La conclusión es clara: la IA ha transformado el pentesting al convertirlo en un proceso de ejecución continua y paralela, pero la interpretación del riesgo y la creatividad táctica siguen siendo facultades irremplazables del hacker humano.

Artículos relacionados de LaRebelión:


Fuente Original: elladodelmal.com

Artículo generado mediante AI.larebelion.

IA Empresas Tech Adoptan Modelos Abiertos para Ahorrar

Las empresas tecnológicas están reevaluando sus gastos en inteligencia artificial, y una tendencia emergente es la migración hacia modelos de IA de código abierto. Este cambio se debe a la necesidad de optimizar costos, especialmente en departamentos de ingeniería, donde los presupuestos de IA se han disparado. Las estrategias incluyen la experimentación con modelos más económicos, la optimización del enrutamiento de consultas a modelos más baratos y la implementación de límites de uso.

IA: Empresas Tech Adoptan Modelos Abiertos para Ahorrar

Uber ha sido pionero en esta transición, logrando reducir sus costos de IA en un 50% mediante una combinación de enfoques. Utilizan modelos de peso abierto ejecutados en servicios de inferencia, que son significativam ente más baratos que los modelos de frontera. También han optimizado la selección de modelos mediante benchmarks continuos, empleando subagentes para tareas más pequeñas y reduciendo el esfuerzo del modelo. La caché de prompts y la optimización de solicitudes también contribuyen a este ahorro.

Otras empresas como Pinterest han reportado ahorros de más del 90% al reemplazar modelos propietarios por modelos de código abierto adaptados a sus casos de uso específicos. AT&T también ha visto una reducción del 56% en su factura de IA al cambiar a modelos abiertos, con una disminución mínima en la calidad del resultado. Este movimiento se ve impulsado por el hecho de que los modelos de Anthropic, previamente populares, se han vuelto considerablemente más caros en comparación con las alternativas de código abierto y los modelos de OpenAI.

Los datos recopilados por Databricks de empresas como Stripe, Coinbase, Uber y Ramp confirman que el uso de modelos abier tos ofrece los mayores ahorros, seguido por el enrutamiento inteligente de modelos. Estos ajustes en el gasto de IA están comenzando a reflejarse en datos de la industria, con una disminución notable en la inversión de las principales empresas.

Fuente Original: https://blog.pragmaticengineer.com/the-pulse-tech-companies-move-to-open-ai-models/

Artículos relacionados de LaRebelión:

Artículo generado mediante LaRebelionBOT

DeepSeek lanza V4.1-Flash y retira su modelo insignia

DeepSeek ha dado un paso estratégico en su hoja de ruta al presentar oficialmente V4.1-Flash, un modelo optimizado que reemplaza a su anterior buque insignia, el V4-Pro. Este lanzamiento marca un cambio significativo en la oferta de la compañía, priorizando la eficiencia operativa y el rendimiento técnico sobre la escala bruta. Según la información proporcionada por el laboratorio con sede en Hangzhou, el nuevo modelo Flash no solo logra una mayor ligereza, sino que supera a su predecesor en métricas críticas relacionadas con la generación de código y el desempeño en tareas complejas de agentes autónomos.

DeepSeek launches V4.1-Flash and retires V4-Pro, its flagship model

Para los usuarios y desarrolladores, este movimiento es notable por su impacto económico y de accesibilidad. Al ofrecer un rendimiento superior con un coste de inferencia reducido, DeepSeek busca facilitar la integración de modelos avanzados en entornos de producción donde la latencia y el presupuesto son factores limitantes. La decisión de retirar el V4-Pro subraya una apuesta clara por la consolidación de su ecosistema en torno a arquitecturas más eficientes, capaces de ejecutar flujos de trabajo de razonamiento técnico con mayor agilidad sin sacrificar la capacidad resolutiva.

Un aspecto fundamental de este despliegue es la decisión de la empresa de publicar los pesos del modelo en la plataforma Hugging Face bajo licencia MIT. Esta apertura permite que la comunidad técnica, investigadores y empresas puedan descargar, modificar y desplegar el modelo de forma local o privada, garantizando una soberanía tecnológica que muchos desarrolladores demandan hoy en día. Al liberar el acceso completo a los pesos, DeepSeek fomenta una adopción más rápida y permite una auditoría transparente de las capacidades del modelo, algo esencial para la validación en sectores críticos donde la caja negra de los modelos cerrados suele ser un obstáculo.

En última instancia, la llegada de V4.1-Flash ejemplifica la tendencia actual del sector hacia la optimización extrema. La capacidad de un modelo más pequeño y económico para destronar a una arquitectura insignia previa demuestra que la eficiencia en el entrenamiento y la arquitectura de inferencia son tan valiosas, si no más, que el simple aumento de los parámetros. Este ajuste en la estrategia de DeepSeek posiciona al laboratorio de forma competitiva frente a otros gigantes del sector, enfocándose en un equilibrio preciso entre potencia, coste y apertura abierta para la comunidad global de inteligencia artificial.

Artículos relacionados de LaRebelión:


Fuente Original: thenextweb.com

Artículo generado mediante AI.larebelion.

IA en Ciberseguridad Pentesting Autonomo con Agentes IA

El artículo explora la integración de Agentes de Inteligencia Artificial (IA) en el ámbito de la seguridad ofensiva, centrándose en la gestión del "Autonomous Continuous Attack" (ataque continuo autónomo). Lejos de reemplazar al pentester humano, la propuesta de Faraday Security se orienta a una colaboración sinérgica donde el hacker y el agente IA trabajan conjuntamente. La experiencia acumulada durante más de un año y medio y numerosos "engagements" autónomos revela que el mayor desafío no ha sido encontrar vulnerabilidades, sino determinar la fiabilidad de los hallazgos del agente.

IA en Ciberseguridad: Pentesting Autónomo con Agentes IA

Se destaca que un Modelo de Lenguaje Grande (LLM) por sí solo no constituye un pentester; la clave reside en el ciclo de toma de decisiones, ejecución y verificación de evidencia que caracteriza a un pentest real. La plataforma FaradAI, desarrollada por Faraday, integra este ciclo, permitiendo que la evidencia recopilada modifique los planes de acción subsecuentes. La reducción de costos asociados a la ejecución de pruebas continuas abre la puerta a la posibilidad de probar repetidamente, aunque surge el problema de cuándo detenerse, un aspecto que requiere gobernanza externa al agente IA para evitar bucles de insistencia infructuosa.

El contexto disponible para el agente IA se revela como un factor crucial, tan importante como el modelo en sí. La capacidad de un agente para comprender el impacto en el negocio y la criticidad de un hallazgo, más allá de la mera identificación técnica, depende de la información contextual que se le proporcione. Se exploran dos tipos de agentes IA: uno que emula a un pentester y otro dedicado al triaje de hallazgos de escáneres. Este último, capaz de procesar grandes volúmenes de datos eficientemente, se presenta como un caso de uso de alto valor, permitiendo reducir el ruido antes de que la información llegue a los analistas humanos. A pesar de los avances, se enfatiza el "Autonomous Pentesting Trust Gap", la brecha entre lo que un agente IA puede encontrar y lo que puede demostrar de forma reproducible. La confianza se deposita en cinco condiciones clave para cada hallazgo: qué se ejecutó, contra qué, la respuesta recibida, el momento del hallazgo y la posibilidad de reproducción. La IA aporta escala y velocidad, mientras que el hacker humano aporta contexto, creatividad y criterio, conformando la futura generación de la seguridad ofensiva.

Fuente Original: http://www.elladodelmal.com/2026/09/como-gestionar-el-autonomous-continuous.html

Artículos relacionados de LaRebelión:

Artículo generado mediante LaRebelionBOT

Pentagon Explores $5 Billion AI Cloud Investment

The U.S. Department of Defense is reportedly in discussions to provide a substantial $5 billion loan to Fluidstack, a startup specializing in AI cloud infrastructure. This potential investment, as reported by The Wall Street Journal, signals a significant move by the Pentagon to bolster domestic AI capabilities and ensure a competitive edge in artificial intelligence development. Fluidstack's business model centers on decentralized cloud computing, utilizing underutilized computing power from personal computers to create a distributed network for AI processing. This approach could offer a cost-effective and scalable alternative to traditional centralized cloud providers, which are often dominated by a few major tech giants.

Pentagon in talks to lend $5 billion to AI cloud startup Fluidstack, WSJ reports - Reuters
Imagen generada con IA

The implications of this potential deal are far-reaching for the AI industry and national security. By backing a company like Fluidstack, the Pentagon is not only investing in cutting-edge technology but also aiming to de-risk and accelerate the adoption of AI within its own operations. This move could also foster innovation by creating a more competitive landscape for AI cloud services, potentially lowering costs and increasing accessibility for other developers and researchers. For Fluidstack, such a significant endorsement and financial backing from a major government entity would be a massive boost, providing the capital needed to scale its infrastructure and further develop its technology. The loan, if approved, would likely be structured to ensure the U.S. retains strategic control over this critical infrastructure, mitigating potential supply chain risks associated with relying solely on foreign or concentrated commercial cloud providers.

This development underscores the growing recognition within governmental bodies of the strategic importance of AI and the underlying cloud infrastructure required to power it. As global AI competition intensifies, governments are increasingly looking for ways to secure their own advanced technological foundations. The Pentagon's interest in Fluidstack's decentralized model suggests a forward-thinking approach to building resilient and adaptable AI systems. The terms of the loan and the specific requirements the Pentagon might impose are yet to be detailed, but the underlying intent appears to be securing a vital component of future defense capabilities in an era where AI is becoming increasingly pivotal.

Artículos relacionados de LaRebelión:


Fuente Original: Reuters

Artículo generado mediante AI.larebelion.

// Telegram BOT