Những gì mà trình kiểm tra này có thể - và không thể phát hiện

Mỗi người kiểm tra đều có điểm mù, hầu hết đều chôn chúng, trang này là của chúng tôi, toàn bộ, vì một báo cáo mà bạn không thể thẩm vấn là một báo cáo mà bạn không thể tin tưởng.

Động cơ hoạt động thế nào?

Việc kiểm tra chạy trong hai giai đoạn. Thứ nhất, lấy mẫu: chúng tôi lấy mẫu 8- 12 chuỗi từ riêng biệt từ mỗi vùng văn bản của bạn - thích những từ hiếm, lấy mẫu tốt hơn nhiều so với những từ mở rộng phổ biến - và tìm kiếm mỗi từ trên mạng như một cụm từ được trích dẫn chính xác. Điều này tạo ra một tập các trang ứng cử.

Thứ hai, xác thực: chúng tôi tải xuống mỗi trang ứng cử và sắp xếp từng câu văn bản của bạn với nội dung thực của trang, ở địa phương. Từ- cho- từ trùng lặp được phát hiện bằng so sánh cửa sổ từ; gần ngữ với token- trùng lặp và edit- similarity thresholds. Một trang không bao giờ được xếp hạng bởi một công cụ tìm kiếm như là bằng chứng của chính nó - chỉ có so sánh văn bản được xác thực được tính, và mỗi sự trùng lặp mang một con số tin cậy trong báo cáo.

Trước bất kỳ điều gì đó, văn bản của bạn được chuẩn hóa: Các ký tự giống nhau Unicode (một trò đùa tiêu chuẩn cho những người kiểm tra lừa dối) được thu lại lại thành các ký tự tương đương đơn giản, vì vậy các ký tự Cyrill được thay thế không ẩn các sự tương ứng.

Khi chúng ta sẽ bỏ lỡ các trận đấu (thiếu âm tính sai)

  • Nguồn cung cấp trả phí và đăng ký: tạp chí học thuật, hồ sơ tin tức sau các đăng nhập.
  • Cơ sở dữ liệu riêng - bao gồm các kho lưu trữ đề xuất học thuật như Turnitin. Không công cụ công cộng nào có thể xem chúng; bất kỳ kiểm tra miễn phí nào có nghĩa khác là nói dối bạn.
  • Nguồn ngoài mạng: sách in và các bài báo chưa bao giờ được đưa lên mạng.
  • Nội dung rất mới: các trang được đăng vào phút hoặc giờ trước mà các công cụ tìm kiếm chưa liệt kê.
  • Đọc lại nặng: viết lại thay đổi hầu hết từ dưới mức gần giống. Tìm ra ý tưởng (thay vì từ) là ngoài khả năng của bất kỳ trình so sánh văn bản nào.

Khi nào chúng ta sẽ đánh dấu văn bản vô tội (dương tính sai)

  • Vật liệu được trích dẫn đúng - một trích dẫn nên phù hợp với nguồn của nó. Kiểm tra trích dẫn, không phải điểm nhấn.
  • Các cụm từ phổ biến và boilerplate: biểu hiện cổ phiếu, công thức pháp lý, mô tả phương pháp lặp lại trên toàn bộ lĩnh vực.
  • Thư mục và danh sách tham khảo, tự nhiên phù hợp với các tác phẩm họ trích dẫn.
  • Tình cờ viết ngắn gọn, câu nói đúng sự thật.

Đây là lý do tại sao báo cáo cho thấy văn bản nguồn tương ứng bên cạnh của bạn, câu theo câu, với các sự tương ứng chính xác và gần như được đánh dấu riêng biệt: công cụ tìm thấy trùng lặp; một người đánh giá ý nghĩa của nó.

Điểm số có nghĩa là gì?

Tỷ lệ tương ứng là phần của từ của bạn nằm trong câu được sắp xếp theo nguồn lấy được. Các dải đo - 0- 5% trông giống gốc, 6- 20% một số tương ứng, 21% + tương ứng đáng kể - là hướng dẫn xem xét được cài đặt cho văn xuôi điển hình, không phải là giới hạn cáo buộc. Một báo cáo 4% vẫn có thể chứa một đoạn văn hoàn toàn sao chép đáng sửa; một báo cáo 25% của tài liệu trích dẫn đúng có thể là một công việc hoàn toàn trung thực.

Chúng tôi cũng nói với bạn có bao nhiêu nguồn thực sự được kiểm tra cho kiểm tra của bạn - số lượng thực sự, in trên báo cáo, vì các tuyên bố phủ sóng mà bạn không thể kiểm chứng là tiếp thị, không chính xác.

Results are indicative, not conclusive. We compare your text against publicly accessible web pages at the moment you run the check. We cannot detect matches in sources that are offline, paywalled, unindexed, or held in private databases (including academic submission archives). Common phrases, correctly quoted material, and coincidental wording can appear as matches. Use this report as a guide for review and citation - not as standalone proof that text was or was not plagiarized.

Câu hỏi thường gặp

Two phases. First we sample distinctive word sequences from your text and search them on the live web as exact phrases. Then we download every candidate page and align every sentence of your text against the page’s real content locally - exact matches by rolling word-window comparison, near matches by token overlap and edit similarity. Search results alone are never trusted as matches; only verified text comparison counts.

When the source is not on the public web at check time: paywalled journals, offline books, private submission archives, pages published minutes ago that search engines have not indexed, or content behind logins. Heavily paraphrased text can also fall below the near-match threshold. No web-based checker escapes these limits; we would rather tell you than let a 0% mislead you.

Correctly quoted passages, common stock phrases, technical boilerplate, legal or religious formulae, and bibliographies all legitimately match their sources. The report separates exact from near matches and shows the source text beside yours so a human can make the call - the score is an instrument reading, not a judgment.

It is the share of your words that sit in sentences we matched to a retrieved source: matched-sentence words divided by total words. The gauge bands are 0-5% "looks original", 6-20% "some matches - review citations", 21%+ "significant matching". The bands are review guidance, not accusation thresholds.

The interface runs in 100+ languages, and the engine itself is multilingual: sentence segmentation handles Latin, CJK and Arabic punctuation, and retrieval uses engines with strong non-English coverage. Match quality is best in languages with a large public web footprint; for very small languages, coverage is honestly thinner.