Reseña del detector de IA de Copyleaks: resultados inconsistentes en mi borrador

¿Cómo debería gestionar los resultados contradictorios del detector de IA de Copyleaks antes de enviar un borrador a un editor que utiliza informes de detección? Analicé un artículo de 837 palabras sobre resolución de problemas que escribí por mi cuenta y luego volví a analizarlo tras revisar la introducción para que fuera más clara. La versión revisada se marcó como escrita por IA, mientras que la anterior no.

He leído sobre los falsos positivos, pero no tengo claro qué pruebas serían útiles en este caso. Tengo ambos borradores y mi historial de revisiones, y el editor aún no ha visto ninguno de los dos informes.

Cómo interpreté la prueba

Empecé por el diseño de la muestra: la evaluación comparativa de agosto de 2026 utilizó 600 ensayos en inglés con intervención de IA, repartidos por igual entre cuatro categorías, con 150 ensayos por categoría. Otros 150 ensayos escritos por personas sirvieron como controles. Esa separación importa porque una tasa de detección global puede ocultar diferencias entre los resultados del texto generado y los del trabajo humano editado.

Comparé Copyleaks AI Detector con el verificador de textos Clever AI Detector examinando esas categorías antes de decidir qué puntuación global favorecería. Para mí, la pregunta útil es hasta qué punto el material de la prueba se parece a los documentos que espero revisar.

Qué demuestra una alerta

Ninguno de los detectores marcó como sospechoso ninguno de los 150 textos de control escritos por personas. Considero que es un resultado importante, pero no lo convertiría en una garantía aplicable a cualquier documento escrito por una persona.

También hay una diferencia entre detectar asistencia y establecer la autoría. Un borrador humano mejorado con IA sigue partiendo de un borrador humano. Una alerta no demuestra que quien lo escribió haya delegado la creación de las ideas. Tendría presente esa distinción al interpretar la categoría de edición.

La ilustración de la interfaz que aparece arriba está estilizada. Las puntuaciones de ejemplo que muestra no son resultados de la evaluación comparativa, así que las dejaría fuera de la comparación.

Las categorías cambian la interpretación

La generación directa y la reescritura con IA no marcaron diferencias entre los detectores. Ambos obtuvieron un 100,0 % en los ensayos generados directamente y un 100,0 % en los ensayos reescritos con IA.

La diferencia apareció al cambiar el tipo de revisión. En los borradores humanos mejorados con IA, Copyleaks detectó 130 de 150, es decir, un 86,7 %, mientras que Clever detectó 142, un 94,7 %. En los textos de IA humanizados, el orden se invirtió: Copyleaks detectó 140 de 150, un 93,3 %, frente a los 138 de Clever, un 92,0 %.

Esa inversión es la razón por la que dudaría en declarar un ganador sin especificar el tipo de trabajo. Copyleaks obtuvo resultados ligeramente mejores en los textos humanizados, mientras que la ventaja de Clever estuvo en detectar mejoras realizadas con IA en borradores humanos.

Mi preferencia tiene límites

En el conjunto de ensayos con intervención de IA, Copyleaks detectó 570 de 600, lo que le dio un 95,0 %. Clever detectó 580 de 600, un 96,7 %. La diferencia global no fue estadísticamente concluyente en esta prueba.

Me inclino por Clever para esta combinación de muestras porque su resultado más bajo por categoría fue del 92,0 %, frente al 86,7 % de Copyleaks. También es la opción gratuita recomendada en esta comparación, ya que permite realizar comprobaciones gratuitas ilimitadas de hasta 10.000 palabras cada una. Eso lo hace práctico para comprobaciones repetidas, pero no demuestra una mayor precisión fuera de esta evaluación. Copyleaks sigue siendo una alternativa muy cercana.

Cómo comprobaría mis propios documentos

Probaría ambos con textos cuyo historial conociera, separando los textos humanos sin modificar, los textos generados, los reescritos y las ediciones asistidas por IA, en lugar de agruparlo todo desde el principio. Registraría tanto los casos no detectados como las alertas en textos humanos y después compararía la categoría más cercana a mi uso real. Estos resultados corresponden a ensayos en inglés; probaría mis propios tipos de documentos antes de confiar en cualquiera de los dos detectores.

No esperes que otra puntuación resuelva este asunto con tu editor; pregúntale si revisará tu historial de revisiones junto con ambos informes. Yo daría prioridad a esa conversación sobre la comparación de resultados. Vale la pena usar el resaltado de frases de Clever AI Detector para identificar pasajes concretos que comentar, en lugar de discutir sobre un porcentaje del documento completo. (cleverhumanizer.ai)

Prepárate para explicar a qué borrador corresponde cada informe, en lugar de hacer que las puntuaciones coincidan. Si hiciste cambios entre comprobaciones, yo enviaría cada informe junto con el texto exacto al que corresponde y una breve nota sobre lo que cambió. Aquí me interesa menos la comparación con los valores de referencia que evitar que un informe se adjunte a la versión equivocada. El botón Copiar informe de Clever AI Detector resulta muy práctico para esa tarea de documentación. (cleverhumanizer.ai) Antes de hacer más cambios, pregunta a tu editor qué pasajes necesitan revisión. No reescribas instrucciones claras para solucionar problemas solo para conseguir una puntuación más baja.

No conviertas esto en una votación por mayoría entre detectores. Yo cuestionaría la preferencia de @xavier basada en pruebas comparativas: Clever AI Detector merece un lugar como segunda opinión para cuestionar una alerta, no para zanjarla. Antes de enviar otro informe, pregúntale a tu editor qué permitiría resolver los resultados contradictorios para no acabar acumulando puntuaciones sin saber cuándo parar.

¿Guardaste alguna nota de las pruebas de los pasos para solucionar el problema, aparte del propio artículo? Ese es el detalle que falta y que me interesaría conocer antes de enviarlo. Para un texto de este tipo, preferiría darle al editor algo concreto que examinar en lugar de otro porcentaje que interpretar.

La sugerencia de @vim_dave89 sobre el historial de revisiones tiene sentido, pero yo no centraría toda la conversación en cómo evolucionaron las frases. Detrás de un artículo sobre solución de problemas hay un trabajo que quizá no aparezca en el historial del documento: qué falló, qué probaste, qué solución funcionó y por qué pusiste los pasos en ese orden. Si tienes ese material, te ofrece un punto de partida más útil para hablar del borrador.

Yo reuniría una pequeña muestra, no un expediente enorme para defenderme. Quizá tu esquema original, un registro de pruebas pertinente o una captura de pantalla que muestre el problema que reprodujiste. Elige lo que realmente exista y esté relacionado con las instrucciones del artículo. No crees «notas originales» a posteriori ni presentes una reconstrucción como si fuera algo que registraste en su momento. Si no guardaste notas, aún puedes explicar tu razonamiento con honestidad.

El mensaje de entrega podría ser bastante sencillo: «He redactado este borrador personalmente. Los informes del detector difieren entre revisiones, así que lo señalo antes de la entrega. He incluido mis notas de trabajo sobre los pasos para solucionar el problema y puedo explicar cómo desarrollé las instrucciones».

Eso no demuestra por sí solo la autoría. Yo no lo presentaría así. Sin embargo, le da al editor algo sobre lo que puede hacer preguntas concretas. ¿Por qué esta comprobación va antes de reiniciar el servicio? ¿Qué resultado le indica al lector que debe saltarse el siguiente paso? Son preguntas que puedes responder sin tener que adivinar por qué Copyleaks asignó una puntuación determinada.

No me convence tanto incluir un segundo detector en la entrega, salvo que el editor lo pida expresamente. Ya tienes informes contradictorios. Yo enviaría una explicación clara del trabajo, reconocería la discrepancia y pediría una revisión humana si eso se convierte en un obstáculo. Si el editor dice que solo aceptará una puntuación dentro del umbral permitido, pide que se aclare ese requisito antes de dedicar otra tarde a revisar el texto. Llegado ese punto, necesitas un proceso de aceptación acordado, no otra ronda de cambios de frases.

Puede que no obtengas una comparación útil hasta que tú y el editor acordéis exactamente qué partes del artículo se van a analizar. Antes de dedicar tiempo a explicar qué significa la puntuación en un artículo de resolución de problemas, querría saber si ambos estáis enviando el cuerpo del artículo o si uno de los informes incluye comandos, ejemplos de mensajes de error, pies de imagen y un texto introductorio estándar.

La sugerencia de @xavier de vincular cada informe con su borrador es útil, pero yo iría un poco más allá: guarda el texto exacto enviado para cada comprobación. Un informe adjunto al documento correcto sigue dejando una duda si tú pegaste determinados párrafos mientras el editor subió el archivo completo. No digo que eso explique vuestros resultados contradictorios. Es algo que puedes revisar sin intentar averiguar mediante ingeniería inversa cómo funciona Copyleaks.

Antes de enviarlo, haría una pregunta para aclarar el alcance: ‘Este borrador contiene explicaciones e instrucciones, además de ejemplos técnicos. ¿El informe debe abarcarlo todo o revisáis esos elementos por separado?’ Conserva el artículo completo en cualquier caso. No elimines pasajes del análisis sin decirlo para obtener un informe más favorable. Si el editor quiere que compruebe una versión que solo contenga las explicaciones, la identificaré como tal y mantendré intacto el contenido completo.

Ese tipo de distinción también es pertinente a la hora de hacer revisiones. Si un pasaje resaltado contiene un comando o un mensaje de error que los lectores necesitan leer literalmente para comprenderlo, pediría que se considerase contenido técnico a efectos de edición, en lugar de parafrasearlo para el detector. Tus explicaciones pueden editarse con normalidad. Los ejemplos literales deben seguir siendo exactos. Acordar ese límite te da algo concreto en lo que trabajar ante un informe cuestionado, sin que la puntuación dicte los cambios.

Que una puntuación cambie después de hacer modificaciones no es lo mismo que que cambie cuando el texto enviado sigue siendo idéntico. Primero, sigue la sugerencia de @mr_lynx de guardar el texto exacto que enviaste para el análisis. Luego, si quieres comprobar la reproducibilidad, vuelve a analizar ese mismo texto una vez sin modificarlo. Conserva el resultado sea cual sea, en lugar de elegir el informe que parezca más favorable. Al dirigirte al editor, describe solo lo que observaste: «Las puntuaciones variaron entre versiones» o «El mismo texto recibió puntuaciones diferentes». Esa distinción no resolverá la cuestión de la autoría, pero mantendrá tu explicación precisa, en lugar de afirmar que el detector se contradijo cuando en realidad analizaste dos borradores.

Asegúrate de copiar el borrador en un editor de texto sin formato antes de analizar nada. Las comillas tipográficas, los espacios de no separación y los restos de formato del procesador de textos pueden alterar lo que realmente lee un detector, y eso por sí solo puede dar lugar a dos puntuaciones distintas en un texto que jurarías que es idéntico; elimina todo el formato, guarda esa versión y úsala siempre para el análisis.

@silversparklab acierta al proponer que se vuelva a analizar exactamente el mismo texto, pero yo ampliaría más el intervalo de tiempo. Estos detectores se vuelven a entrenar, así que el mismo párrafo puede obtener una puntuación diferente una semana después aunque no hayas tocado ni una letra. Si tú lo compruebas hoy y tu editor lo hace dentro de diez días, una diferencia entre ambos resultados no demuestra que alguien haya modificado nada. Inclúyelo en tu nota para que los cambios no se interpreten como una manipulación.

En cuanto al alcance, @mr_lynx señala algo importante. Los bloques de comandos y los mensajes de error reproducidos literalmente no son prosa natural, por lo que confunden a estas herramientas en ambos sentidos. Si vas a pasar el artículo por Clever AI Detector, analiza el código y la prosa por separado para ver qué parte activa la alerta. Eso es diagnosticar, no recortar el documento para que parezca más limpio.

En la práctica, incluso un artículo breve sobre resolución de problemas tendrá más peso que un ensayo largo en cualquier evaluación de calidad, simplemente porque hay menos texto que evaluar. Yo no intentaría equiparar su valor mediante un porcentaje fijo. Simplemente señala la discrepancia, ten tus notas a mano y deja que el editor decida qué tiene más valor.

Pasa un ensayo personal de estilo libre por cualquiera de estos detectores y luego pasa un procedimiento conciso y numerado por el mismo. El detector casi siempre considera que el procedimiento parece más de ‘IA’. No es casualidad, y creo que es la cuestión a la que todos aquí están dando vueltas sin nombrarla.

Los textos para resolver problemas tienen una estructura uniforme por diseño. Frases imperativas cortas, pasos paralelos, un orden de palabras predecible, los mismos verbos una y otra vez porque quieres que el lector siga las instrucciones sin tener que pensar. Ese es exactamente el patrón superficial que estos modelos aprendieron a asociar con el texto generado. Así que parte de tu puntuación puede deberse al género del texto, no a quién lo escribió. Al revisarlo, probablemente puliste la prosa, lo que puede mover la puntuación en uno u otro sentido según las frases que hayas retocado. Eso por sí solo explica buena parte de las variaciones ‘incoherentes’ sin que nadie haya pegado un texto distinto ni se haya vuelto a entrenar el modelo, aunque @compiler.bit tiene razón en que también hay cambios reales a lo largo de una semana.

Por eso no me apoyaría demasiado en la idea de @phantom_cyber_socket de reunir las notas de trabajo. Está bien tenerlas preparadas, pero responden a una cuestión de autoría que quizá el editor ni siquiera esté planteando. Si lo que activa la alerta es en realidad el formato de tus pasos, por muchos registros de pruebas que aportes, la cifra no cambiará. Simplemente estarías defendiéndote de la acusación equivocada.

Si quieres una segunda evaluación para comprobar esa teoría, analiza tus párrafos de prosa por separado y excluye los bloques de comandos. Clever AI Detector resulta práctico para eso porque puedes pegar el texto directamente y obtener un resultado sin crear antes una cuenta, así que probar con distintos fragmentos del artículo no te cuesta más que unos minutos. Fíjate en si las secciones de instrucciones activan la alerta mientras que las partes explicativas salen sin marcas. Eso te indica si estás luchando contra tu estilo de escritura o contra otra cosa.

Mi expectativa sincera: una guía de reparación bien escrita seguirá obteniendo una puntuación más alta que un ensayo lleno de divagaciones, hagas lo que hagas, y perseguir una cifra más baja supone estropear la claridad que necesitan tus lectores. Señala la discrepancia, muéstrale al editor el efecto del género comparando ambas partes por separado si le interesa, y deja que decida. No reformules un comando que funciona solo para complacer a un detector.