Los límites de la IA en ventas no son un detalle de letra chica: definen dónde conviene usarla. Un modelo de lenguaje no distingue con fiabilidad lo que sabe de lo que está completando, pierde desempeño cuando la tarea tiene varios pasos, no tiene criterio propio sobre qué información es confidencial, no reemplaza al vendedor en el momento en que el comprador necesita confianza y facilita generar un volumen de correo que las plataformas penalizan. Todo lo anterior está documentado públicamente. Este artículo reúne esa evidencia para que decidas con datos y no con una demo.
1. No sabe cuándo no sabe
Es el límite del que se derivan casi todos los demás. El artículo Why Language Models Hallucinate, de Adam Kalai, Ofir Nachum, Santosh Vempala y Edwin Zhang (OpenAI y Georgia Tech, 4 de septiembre de 2025), sostiene que los modelos producen “afirmaciones plausibles pero incorrectas en vez de admitir incertidumbre” porque los métodos estándar de entrenamiento y evaluación premian adivinar: quien arriesga una respuesta puede acertar, quien deja el espacio en blanco saca cero garantizado. Los autores proponen cambiar la forma de puntuar los benchmarks para que expresar duda no se penalice.
Cómo se ve esto en tu día: le pides el nombre del director de operaciones de una empresa mediana y te lo da. Suena correcto. No existe.
Una medición cercana ilustra el patrón. El Tow Center for Digital Journalism de Columbia publicó el 6 de marzo de 2025 un estudio de 1.600 consultas sobre ocho buscadores con IA: respondieron incorrectamente en más del 60% de los casos y, según los investigadores, presentaron esas respuestas con una confianza notable y casi sin frases de duda. ChatGPT falló en 134 de 200 respuestas, expresó incertidumbre solo 15 veces y nunca se negó a contestar. Ese estudio midió atribución de artículos de prensa, no investigación de cuentas B2B, así que no es una tasa de error trasladable a tu prospección. Lo que sí traslada es la conducta: el silencio no es una opción que el modelo elija.
2. Se degrada cuando la tarea tiene varios pasos
Salesforce AI Research publicó el 24 de mayo de 2025 el benchmark CRMArena-Pro, con diecinueve tareas validadas por expertos en ventas, servicio y cotización. Los mejores agentes evaluados alcanzaron alrededor del 58% de éxito en tareas de un solo turno y cayeron a cerca del 35% en interacciones multiturno. En cambio, la ejecución de flujos de trabajo estructurados superó el 83%.
Esa asimetría es la información más accionable de todo el artículo. La IA rinde donde el trabajo está definido de antemano (extraer campos, clasificar, resumir, ejecutar un paso conocido) y se cae donde el trabajo se parece a una conversación de ventas real, con información que llega a pedazos y objetivos que cambian a mitad de camino.
El mismo estudio reportó otro hallazgo incómodo: los agentes mostraron una conciencia de confidencialidad prácticamente nula por defecto, y cuando se les instruía explícitamente para protegerla, el desempeño en la tarea tendía a empeorar. Traducido: no asumas que la herramienta sabe qué no debe compartir.
3. Hay un techo de valor: más agentes no es más productividad
Gartner predijo el 18 de noviembre de 2025 que para 2028 los agentes de IA superarán diez a uno a los vendedores humanos, y en la misma predicción advirtió que menos del 40% de los vendedores reportará que esos agentes mejoraron su productividad. Melissa Hilbert, VP analyst de la práctica de ventas de Gartner, lo planteó como un techo: “los agentes de IA están en todas partes, pero hay un techo de valor; pasado cierto punto, más IA no significa más productividad”. Añadió que apilar prompts y herramientas sobre flujos ya complejos arriesga saturar a los vendedores y acelerar el desgaste.
Es un contrapeso directo al argumento de “agrega un agente más”. Si el vendedor tiene que supervisar cinco sistemas que producen sugerencias, la carga cognitiva sube y el beneficio neto puede ser negativo.
4. Los proyectos se cancelan por razones que no son técnicas
Gartner predijo el 25 de junio de 2025 que más del 40% de los proyectos de IA agéntica se cancelarán antes de que termine 2027, por costos crecientes, valor de negocio poco claro o controles de riesgo inadecuados. En el mismo comunicado señaló el fenómeno del “agent washing”, el rebautizo de productos existentes como agentes, y estimó que de los miles de proveedores que se presentan como agénticos solo alrededor de 130 lo son realmente.
Ninguna de esas tres causas es “el modelo no daba”. Son alcance, medición y gobierno. Es exactamente donde un equipo comercial pequeño puede ganar: eligiendo un problema chico y midiéndolo.
5. El comprador quiere validar contigo, no con el bot
Según los datos que Gartner presentó en mayo de 2026, reportados por Demand Gen Report, el 69% de los compradores B2B prefiere validar con un representante de ventas los hallazgos que obtuvo con IA generativa. En comparaciones directas, los representantes humanos superaron a la IA generativa por 39 puntos porcentuales en comprender las necesidades del comprador y por 32 puntos en construir confianza en la compra.
Y un dato que ordena las expectativas de ambos lados: el 51% de los compradores dijo que es más probable encontrar información engañosa proveniente de IA generativa, frente al 49% que dijo lo mismo de un vendedor. El comprador desconfía de los dos casi por igual. La ventaja del humano no es la reputación: es la capacidad de responder por lo que dice.
6. Declarar que usas IA tiene un costo en confianza
Oliver Schilke y Martin Reimann publicaron en 2025, en Organizational Behavior and Human Decision Processes, un trabajo con trece experimentos titulado The transparency dilemma: How AI disclosure erodes trust. El resultado es consistente: quienes revelan que usaron IA son percibidos como menos confiables que quienes no lo revelan, y el mecanismo es una caída en la legitimidad percibida. Los autores lo llaman explícitamente un dilema, porque la transparencia se promueve como buena práctica ética y a la vez castiga a quien la ejerce.
Esto no es una licencia para mentir sobre tus herramientas. Es un argumento para que el contenido del mensaje aguante solo: si tu correo aporta un dato que el prospecto reconoce como propio y una hipótesis útil sobre su problema, la discusión sobre quién lo redactó pierde peso.
7. Generar más correos no es lo mismo que llegar
La IA elimina el cuello de botella de escribir, y eso mueve el cuello de botella al buzón del otro. Google exige a quien envía 5.000 o más mensajes diarios a cuentas de Gmail autenticación SPF, DKIM y DMARC, opción de baja de un clic en mensajes de marketing (obligatoria desde el 1 de febrero de 2024) y mantener la tasa de spam reportada en Postmaster Tools por debajo de 0,30%. Con generación automática, ese umbral se cruza más rápido que nunca.
Si la respuesta a “¿cuánto podemos escalar?” es “todo lo que quieras”, tienes delante un problema de entregabilidad esperando a ocurrir. Detalle práctico en por qué mis correos caen en spam.
Qué esperar de verdad
Un resumen sin adornos de lo que la evidencia soporta hoy:
| Promesa habitual | Expectativa realista |
|---|---|
| ”La IA prospecta por ti” | Prepara la prospección: investiga, resume, prioriza y redacta borradores |
| ”Escala infinita de correos” | Escala limitada por entregabilidad y por la paciencia del comprador |
| ”El agente maneja la conversación” | Rinde en pasos acotados; se degrada en intercambios de varios turnos |
| ”Sabe todo de la cuenta” | Sabe lo que le diste, y rellena lo que falta sin avisar |
| ”Reemplaza a tu SDR” | Le devuelve horas a tu SDR, que sigue decidiendo y respondiendo |
Cinco preguntas para evaluar a un proveedor
- ¿Qué parte es modelo y qué parte es regla? Mucho de lo que se vende como IA son filtros. No está mal, pero cambia el precio justo.
- ¿Qué pasa cuando no encuentra el dato? Si la respuesta no incluye un estado explícito de “no encontrado” o un nivel de confianza, el producto va a inventar en silencio.
- ¿Quién revisa antes de que algo llegue a un cliente? Si nadie, el primer error grave lo descubre tu comprador.
- ¿Dónde viven los datos de mis prospectos, con qué retención y quién los usa para entrenar? Pídelo por escrito.
- ¿Contra qué línea base vamos a medir el piloto? Sin número previo, cualquier resultado se puede narrar como éxito.
Cómo lo tratamos en Growly
Growly usa IA en la preparación, no en el cierre. Cuando infiere el perfil DISC de un lead desde su texto público, muestra el nivel de confianza de esa inferencia, incluido el caso en que solo hubo cargo e industria, y te deja corregirla a mano. Genera borradores de pitch y de opener; los envías tú después de revisarlos.
Preferimos decir esto antes que después: una inferencia débil marcada como débil es más útil que una etiqueta segura y equivocada. Es la misma razón por la que este artículo existe.
Para seguir
- El panorama completo: IA en ventas B2B, qué funciona hoy y qué es humo.
- El lado práctico: cómo usar IA para investigar prospectos.
- Los fundamentos que la IA no reemplaza: qué es un SDR y cadencia de ventas de 21 días.
Fuentes
- Kalai, Nachum, Vempala y Zhang, Why Language Models Hallucinate, arXiv (4 de septiembre de 2025)
- Jaźwińska y Chandrasekar, AI Search Has a Citation Problem, Tow Center for Digital Journalism, Columbia Journalism Review (6 de marzo de 2025)
- Huang et al., CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions, Salesforce AI Research, arXiv (24 de mayo de 2025)
- Gartner: by 2028 AI agents will outnumber sellers by 10x, yet fewer than 40% of sellers will report AI agents improved productivity (18 de noviembre de 2025)
- Gartner predicts over 40% of agentic AI projects will be canceled by end of 2027 (25 de junio de 2025)
- Demand Gen Report: Gartner, AI is reshaping B2B buying, but human sellers still close the confidence gap (26 de mayo de 2026)
- Schilke y Reimann, The transparency dilemma: How AI disclosure erodes trust, Organizational Behavior and Human Decision Processes (2025)
- Google: requisitos para remitentes de correo electrónico