Egiaztatzaile honek detekta dezakeena eta detekta ezin dezakeena

Plagioa egiaztatzen duen edozeinek puntu itsu batzuk ditu. Gehienak lurperatu egiten dituzte. Orri hau gurea da, osorik, galdetu ezin daitekeen txostena ez baita fidagarria.

Nola funtzionatzen duen motorrak

Egiaztapena bi fasetan burutzen da. Lehenengo, berreskurapena: testuaren eskualde guztietatik 8- 12 hitz sekuentzia bereizgarri lagintzen ditugu - hitz arraroak nahiago ditugu, irekitzaile arruntak baino askoz hobeto berreskuratzen baitira - eta web-ean bilatzen ditugu, aipaturiko esaldi zehatzak bezala. Horrek hautagai-orri multzo bat sortzen du.

Bigarrenik, egiaztapena: hautagai-orrialde bakoitza deskargatzen dugu eta zure testuko esaldi bakoitza lerrokatzen dugu orriaren benetako edukiarekin, lokalki. Hitzetik hitzerako gainezkatzea hitz-leiho konparaketa mugikorrean detektatzen da; parafrasia hurbila token-gainezkatze eta edit-antzekotasun-atalaseekin. Bilaketa-motorrak orrialde bat sailkatzen duenean, ez da inoiz bere kabuz frogatzat hartzen - egiaztatutako testu-konparaketa bakarrik kontuan hartzen da, eta bat-etorri bakoitzak konfiantza-zenbaki bat du txostenean.

Hori egin aurretik, zure testua normalizatu egiten da: Unicode-ren antzeko karaktereak (egiaztatzaileak engainatzeko trikimailu estandarra) beren baliokide arruntetara tolesten dira, letra ziriliko trukatuak ez baitira bat datozen karaktereak ezkutatzen.

Bat datozen puntuak galduko ditugun unea (negatibo faltsuak)

  • Egileak: Aitor Arregi eta Iñaki Alegria, Euskaltzaindiaren Hiztegi Entziklopedikoa.
  • Datu-base pribatuak - Turnitin-en bezalako bidalketa akademikoen artxiboak barne. Ezin dira tresna publikoek ikusi; bestela esaten duen edozein egiaztatzaile librek gezurra esaten dizu.
  • Offline iturriak: inoiz webgunean jarri ez diren liburu eta paperak.
  • Eduki oso freskoa: duela minutu edo ordu batzuk argitaratutako orrialdeak, bilatzaileek oraindik indexatu ez dituztenak.
  • Parafrasi gogorra: hitz gehienak aldatzen dituen biridazketa bat-etortze-atalasearen azpitik doa. Ideiak detektatzea (hitz-jokoak baino gehiago) testu-bat-etortzaile guztien gainetik dago.

Testu errugabea markatuko dugun unea (positibo faltsuak)

  • Ongi aipatua materiala - aipu batek bere iturria bete behar du. Egiaztatu aipua, ez nabarmentzea.
  • Esaldi arruntak eta boilerplate: stock adierazpenak, formula legalak, metodologia deskribapenak errepikatzen dira eremu osoan zehar.
  • Bibliografia eta erreferentzia zerrendak, normalean aipatzen diren lanak betetzen dituztenak.
  • Hitz-joko laburrak, esaldi laburrak.

Horregatik, txostenak bat datozen iturburu-testuak erakusten ditu zure testuaren ondoan, esaldiz esaldi, bat datozen zehatzak eta hurbilekoak bereizita markatuta: tresnak gainezkatzea aurkitzen du; pertsona batek esanahia epaitzen du.

Puntuazioak zer esan nahi duen

Bat datozen ehunekoa itzulitako iturburuarekin lerrokatuta dauden esaldietan dauden hitzen ehunekoa da. Neurri- bandak - %0-5 originala dirudi, %6-20 bat datozen batzuk, %21+ bat datozen esanguratsu batzuk - prosa ohikoarentzat kalibratutako berrikuspen- gida dira, ez akusazio- muga. %4 txosten batek oraindik ere konpondu beharreko paragrafo osoa kopiatu dezake; behar bezala aipaturiko materialaren %25 txosten batek lan oso zintzoa izan daiteke.

Gainera, zenbat iturri aztertu diren ere esaten dizugu, txostenean agertzen den zenbaki erreala, egiaztatu ezin diren estalduren aldarrikapenak marketina dira, ez zehaztasuna.

Results are indicative, not conclusive. We compare your text against publicly accessible web pages at the moment you run the check. We cannot detect matches in sources that are offline, paywalled, unindexed, or held in private databases (including academic submission archives). Common phrases, correctly quoted material, and coincidental wording can appear as matches. Use this report as a guide for review and citation - not as standalone proof that text was or was not plagiarized.

Maiz egiten diren galderak

Two phases. First we sample distinctive word sequences from your text and search them on the live web as exact phrases. Then we download every candidate page and align every sentence of your text against the page’s real content locally - exact matches by rolling word-window comparison, near matches by token overlap and edit similarity. Search results alone are never trusted as matches; only verified text comparison counts.

When the source is not on the public web at check time: paywalled journals, offline books, private submission archives, pages published minutes ago that search engines have not indexed, or content behind logins. Heavily paraphrased text can also fall below the near-match threshold. No web-based checker escapes these limits; we would rather tell you than let a 0% mislead you.

Correctly quoted passages, common stock phrases, technical boilerplate, legal or religious formulae, and bibliographies all legitimately match their sources. The report separates exact from near matches and shows the source text beside yours so a human can make the call - the score is an instrument reading, not a judgment.

It is the share of your words that sit in sentences we matched to a retrieved source: matched-sentence words divided by total words. The gauge bands are 0-5% "looks original", 6-20% "some matches - review citations", 21%+ "significant matching". The bands are review guidance, not accusation thresholds.

The interface runs in 100+ languages, and the engine itself is multilingual: sentence segmentation handles Latin, CJK and Arabic punctuation, and retrieval uses engines with strong non-English coverage. Match quality is best in languages with a large public web footprint; for very small languages, coverage is honestly thinner.