O que este comprobador pode e non pode detectar

Cada comprobador de plagio ten puntos cegos. A maioría enterraos. Esta páxina é a nosa, en total, porque un informe que non pode interrogar é un informe no que non pode confiar.

Como funciona o motor

A comprobación executase en dúas fases. Primeiro, a recuperación: mostramos secuencias distintivas de 8- 12 palabras de cada rexión do texto - preferimos palabras raras, que se recuperan moito mellor que as iniciais comúns - e procuramos cada unha delas na web como unha frase exacta citada. Isto produce un conxunto de páxinas candidatas.

Segundo, a verificación: obtemos cada páxina candidata e aliñamos cada frase do seu texto co contido real da páxina, localmente. A superposición palabra por palabra é detectada coa comparación de fiestra de palabra; a paráfrase próxima co limiar de superposición de símbolo e de similitude de edición. Un motor de procuras que clasifica unha páxina nunca é tratado como proba por si só - só conta a comparación de texto verificada, e cada coincidencia leva unha cifra de confianza no informe.

Antes de todo isto, o texto normalízase: os caracteres Unicode similares (un truco estándar para enganar aos verificadores) contraéronse de volta aos seus equivalentes simples, de xeito que as letras cirílicas trocadas non agochan as coincidencias.

Cando perderemos coincidencias (falsos negativos)

  • Fontes de pago e de subscrición: revistas académicas, arquivos de noticias detrás dos logins.
  • Bases de datos privadas, incluíndo arquivos de entregas académicas como Turnitin. Non hai ferramenta pública que as poida ver; calquera verificador libre que suxira o contrario está a mentir.
  • Fontes fóra de liña: libros e artigos impresos que nunca se puxeron na web.
  • Contido moi recente: páxinas publicadas hai minutos ou horas que os motores de procura aínda non indexaron.
  • Parafrasear forte: a reescritura que cambia a maioría das palabras cae por baixo do limiar de coincidencia próxima. A detección de ideas (en vez de palabras) está máis alá de calquera coincidencia de texto.

Cando se sinalizarán os textos inocentes (falsos positivos)

  • Material citado correctamente - unha cita debe coincidir coa súa fonte. Comprobe a cita, non o realce.
  • Frases comúns e estándar: expresións comúns, fórmulas legais, descricións metodolóxicas repetidas en todo un campo.
  • Bibliografías e listas de referencias, que naturalmente coinciden coas obras que citan.
  • Unha frase coincidente en frases curtas e factuais.

É por iso que o informe mostra o texto de orixe coincidente xunto co seu, frase por frase, coas coincidencias exactas e próximas marcadas por separado: a ferramenta atopa a superposición; unha persoa xuíza o que significa.

O que significa a puntuación

A porcentaxe de coincidencias é a porcentaxe das palabras que se atopan en frases aliñadas cunha fonte recuperada. As bandas de medida - 0- 5% parece orixinal, 6- 20% algunhas coincidencias, 21% + coincidencias significativas - son guías de revisión calibradas para prosa típica, non limiares de acusación. Un informe do 4% pode conter un parágrafo copiado enteiramente que vale a pena corrixir; un informe do 25% de material citado correctamente pode ser un traballo perfectamente honesto.

Tamén lle dicimos cantas fontes foron realmente examinadas para a súa comprobación - o número real, impreso no informe, porque as afirmacións de cobertura que non pode verificar son de mercadotecnia, non de precisión.

Results are indicative, not conclusive. We compare your text against publicly accessible web pages at the moment you run the check. We cannot detect matches in sources that are offline, paywalled, unindexed, or held in private databases (including academic submission archives). Common phrases, correctly quoted material, and coincidental wording can appear as matches. Use this report as a guide for review and citation - not as standalone proof that text was or was not plagiarized.

Preguntas frecuentes

Two phases. First we sample distinctive word sequences from your text and search them on the live web as exact phrases. Then we download every candidate page and align every sentence of your text against the page’s real content locally - exact matches by rolling word-window comparison, near matches by token overlap and edit similarity. Search results alone are never trusted as matches; only verified text comparison counts.

When the source is not on the public web at check time: paywalled journals, offline books, private submission archives, pages published minutes ago that search engines have not indexed, or content behind logins. Heavily paraphrased text can also fall below the near-match threshold. No web-based checker escapes these limits; we would rather tell you than let a 0% mislead you.

Correctly quoted passages, common stock phrases, technical boilerplate, legal or religious formulae, and bibliographies all legitimately match their sources. The report separates exact from near matches and shows the source text beside yours so a human can make the call - the score is an instrument reading, not a judgment.

It is the share of your words that sit in sentences we matched to a retrieved source: matched-sentence words divided by total words. The gauge bands are 0-5% "looks original", 6-20% "some matches - review citations", 21%+ "significant matching". The bands are review guidance, not accusation thresholds.

The interface runs in 100+ languages, and the engine itself is multilingual: sentence segmentation handles Latin, CJK and Arabic punctuation, and retrieval uses engines with strong non-English coverage. Match quality is best in languages with a large public web footprint; for very small languages, coverage is honestly thinner.