Kiểm tra đạo văn cho công ty luật
Kiểm tra trước khi nộp cho bản ghi, ghi chú, và kiến nghị. Phát hiện chép lại không dẫn nguồn, mẫu câu lặp lại, và văn bản do AI soạn (bao gồm cả rủi ro vụ án ảo). Bảo toàn quyền miễn trừ: tự lưu trữ trong mạng nội bộ, hoặc đặt máy chủ tại EU cho công việc xuyên biên giới. Tài liệu không bao giờ dùng để huấn luyện. Không bao giờ.
Bốn vai trò. Một bước kiểm tra trước khi nộp.
Kiểm tra bản ghi trước khi up partner duyệt
Phát hiện diễn giải chưa dẫn nguồn Bluebook trước khi tới tay partner.
- Tự kiểm tra trước khi partner đọc
- Phân loại nhận diện trích dẫn Bluebook + ALWD
- Chỉ báo AI cho từng đoạn (nếu dùng LLM)
Xác thực sẵn sàng nộp hồ sơ
Chữ ký là của Sie. Nguyên gốc nội dung cũng nên như vậy.
- Danh sách trắng tự trích dẫn toàn công ty (bản ghi trước của Sie)
- Phát hiện vụ án ảo (Mata v. Avianca là ví dụ cảnh báo)
- Vết kiểm tra theo associate để phòng trách nhiệm nghề nghiệp
Quy trình kiểm tra phát hiện, chuẩn bị ghi chú
Hàng loạt memo và phản hồi phát hiện được kiểm tra trước khi đưa vào hồ sơ vụ án.
- Thư mục cho từng vụ · tách riêng hồ sơ
- Cư trú EU dành cho phát hiện xuyên biên giới
- Công cụ Apache 2.0 — dùng để kiểm tra xung đột
Thực thi chính sách AI toàn công ty
Xác thực việc thực hiện đúng chính sách sử dụng AI của công ty.
- Phát hiện AI trên sản phẩm xuất bản của công ty
- Nhật ký xoá dữ liệu theo yêu cầu để phục vụ kiểm toán bảo mật thông tin khách hàng
- Tự lưu trữ trong mạng nội bộ — bảo toàn quyền miễn trừ
Ba bước trước khi lên e-file.
Tự lưu trữ trong mạng nội bộ, hoặc máy chủ cư trú tại EU cho vụ việc xuyên biên giới, hoặc Pro cloud với tách riêng từng tenant. Tùy vào yêu cầu bảo mật mà chọn triển khai phù hợp.
01 · Soạn nội bộ
Tải lên bản ghi / memo / kiến nghị (.docx là chính; .pdf được hỗ trợ). Hồ sơ lưu trong tenant của công ty — kiểm soát truy cập, không dùng chung thư viện, không lộ thông tin giữa các tenant. Nếu tự lưu trữ: tài liệu không rời khỏi VPC.
02 · So khớp với đúng nguồn
Quét tìm nguồn công khai trên web + Common Crawl + kho ý kiến mở (CourtListener, Caselaw Access Project, Google Scholar, Justia). Phân loại trích dẫn để tách rõ dẫn nguồn đúng Bluebook với diễn giải chưa cite. Đánh dấu AI cho từng đoạn — phù hợp vì vụ án ảo là rủi ro thực tế trong toà.
03 · Xác thực trước khi nộp
Báo cáo phân loại từng đoạn: QUOTED·CITED (dẫn nguồn Bluebook, loại trừ), CASE·QUOTE (đủ tên vụ + mã nguồn báo cáo, loại trừ), PARA·CITED (diễn giải có trích dẫn, cân nhắc nhẹ), UNCITED·PARA (cần kiểm tra lại), AI·LIKELY (xác thực hoặc viết lại), HALLUCINATED·RISK (cited case không có trong các kho ý kiến mở — cần xác minh trước khi nộp).
Sáu điều cần xác minh trước khi nộp bản ghi soạn với chatbot.
Mata v. Avianca (S.D.N.Y. 2023) là cảnh báo — luật sư đã trích dẫn sáu vụ án mà ChatGPT tự bịa; toà phạt $5.000 cả cá nhân lẫn công ty. Văn bản pháp lý do AI soạn cần kiểm tra riêng.
01 · TRÍCH DẪN THỰC SỰ
Mỗi vụ án được cite đều được đối chiếu với kho ý kiến mở (CourtListener, Caselaw Access Project, Google Scholar, Justia). Nếu tên vụ + mã nguồn không xuất hiện ở cả bốn nguồn, báo cáo sẽ gắn nhãn HALLUCINATED-RISK. Không có nghĩa vụ án là giả (có thể bị đóng, chưa xuất bản, hoặc thu phí); nhưng có nghĩa Sie cần xác minh trước khi nộp.
02 · ĐỘ CHUẨN XÁC TRÍCH DẪN
Nếu bản ghi dẫn nguyên văn án lệ, công cụ sẽ kiểm tra văn bản đó với ý kiến thực tế. Nếu vụ án đúng mà trích dẫn không trùng khớp, đây là QUOTE-DRIFT — mẫu sai sót thường gặp với LLM. Gắn nhãn riêng, không trùng với kiểm tra tồn tại của citation.
03 · CHÍNH XÁC PINCITE
Kiểm tra số trang trích dẫn trong án lệ. Trang được cite có chứa đúng trích dẫn không. Lỗi phổ biến LLM: vụ án có thật, số trang đúng, nhưng câu dẫn thuộc đoạn khác. Gắn nhãn PINCITE-MISMATCH.
04 · HOLDING so với DICTUM
Tính năng beta (Pro+). Công cụ đối chiếu xem luận điểm được cite thuộc về holding thực sự hay chỉ là dictum. Nhầm lẫn dictum với holding là lỗi LLM kiểu cổ điển, tiềm ẩn nguy cơ vi phạm nghiệp vụ.
05 · BỊ HUỶ BỎ / SỬA ĐỔI
Kiểm tra lịch sử trích dẫn qua API case-history của CourtListener. Nếu vụ án đã bị huỷ, sửa đổi, hoặc phân biệt bởi án lệ sau đó trong cùng liên bang, báo cáo sẽ hiện chi tiết. Nhìn ngoài, dẫn đúng nhưng có thể là dẫn sai về nội dung.
06 · ĐOẠN AI-LIKELY
Chỉ số AI-likelihood trên từng đoạn (dựa trên Binoculars) sẽ ra mắt sớm — đã lên lộ trình, chưa có lúc khởi đầu. Các đoạn được đánh dấu cần được người kiểm duyệt xem lại trước khi nộp. Điều chỉnh riêng cho công ty có luật sư không dùng tiếng Anh gốc — nhãn là ESL ADJ thay vì LIKELY-AI khi đặc điểm ngôn ngữ phù hợp.
Những gì Sie thấy trước khi e-file.
Phân loại từng đoạn: case đã xác minh, diễn giải có/không dẫn nguồn, đoạn bị AI đánh dấu, và HALLUCINATED-RISK nếu không tìm được án lệ trong kho mở.
Ba điều cần từ công cụ kiểm tra để bảo mật luật-sư-khách-hàng.
Engine chạy trong mạng nội bộ của công ty
Apache 2.0 + Docker. Kết nối cùng sẵn có Postgres + Redis trong hạ tầng của Sie. Hồ sơ, dấu vết, báo cáo đều lưu trên máy chủ Sie. Không có lưu lượng nào ra khỏi VPC. Đáp án đúng cho vụ thuộc protective order, tài liệu sealed-dicovery, hoặc bản nháp nhạy cảm work-product.
Cho việc xuyên biên giới liên quan EU
Pro+ triển khai tới api.eu.noplag.com. Lưu trữ trên datacenter Hetzner ở EU (Falkenstein + Helsinki). Hồ sơ, dấu vết, báo cáo ở lại EU. Mặc định tuân thủ GDPR, sẵn DPA khi cần. Dùng cho đại diện EU+UK, GDPR, hay khách EU cư trú.
Hồ sơ gửi không thành data huấn luyện
Bản nháp được nhận diện fingerprint (winnowing hashes, dấu không đảo ngược) và lưu riêng tenant. Văn bản tự động xoá sau 30 ngày trừ khi Sie bật lưu. Model kiểm tra đã huấn luyện từ nguồn public — không bổ sung tài liệu công ty luật. Quy định rõ trong DPA.
Hai điều cho vụ đa thẩm quyền mà công cụ đơn lẻ không đáp ứng.
Hầu hết công cụ đạo văn chỉ dành cho một hệ thống — thường là Mỹ làm chuẩn. Vụ xuyên quốc gia cần nhiều kho ý kiến (Mỹ liên bang + tiểu bang + EU + UK + khối chung...), nhiều chuẩn citation (Bluebook, OSCOLA, McGill, AGLC), nhiều ngôn ngữ (Pháp, Đức, Tây Ban Nha, Bồ Đào Nha cho Nam Mỹ). Công cụ này xử lý đầy đủ. Cư trú EU xử lý khâu dữ liệu. Tự lưu trữ là cho tình huống cloud không đủ an toàn.
Đọc hướng dẫn cho vụ đa thẩm quyềnNhững thắc mắc thường gặp trước khi mua.
- Hồ sơ của chúng tôi có bị dùng để huấn luyện không?
- Không. Nháp được gắn fingerprint (winnowing hashes, không đảo ngược) và lưu tách biệt theo tenant. Văn bản xoá sau 30 ngày trừ phi Sie bật retention. Model kiểm tra đã train bằng nguồn công cộng; không bổ sung tài liệu công ty luật vào training set. Rõ trong DPA. Người tự lưu trữ giữ mọi thứ trong VPC — fingerprint cũng không gửi đi.
- Phát hiện vụ án ảo hoạt động như thế nào?
- Mỗi tên vụ và reporter citation trong bản ghi đều so chiếu với bốn kho ý kiến mở: CourtListener, Caselaw Access Project (Harvard), Google Scholar, Justia. Nếu không có kết quả ở cả bốn, báo cáo gắn HALLUCINATED-RISK. Không chắc là giả — có thể unpublished, sealed, hoặc thu phí — nhưng cần xác minh qua Westlaw/Lexis trước khi nộp. Mata v. Avianca là ví dụ công cụ này hướng đến.
- Có dùng được cho án lệ ngoài Mỹ không?
- Án liên bang + tiểu bang Mỹ, UK + Commonwealth (chuẩn OSCOLA), Canada (McGill Guide), Australia (AGLC), EU (ECJ + ECHR). Quét các kho mở Bailii (UK), CanLII (Canada), AustLII, Curia EU. Án lệ cũ nằm sau paywall (Westlaw/Lexis/juris) sẽ không đối khớp được — vấn đề này iThenticate cũng gặp ở nội dung học thuật có paywall.
- Bảo mật quyền miễn trừ đối với vụ nhạy cảm thế nào?
- Ba tầng. Cloud Pro: cơ sở dữ liệu tenant riêng, hỗ trợ cư trú EU, xoá text sau 30 ngày. Máy chủ cư trú EU (api.eu.noplag.com): lưu ở EU Hetzner, processor GDPR Art.28. Tự lưu trữ: Apache 2.0 + Docker, chạy nội bộ, không có lưu lượng ra ngoài. Chọn tầng phù hợp mức bảo mật cần thiết cho vụ việc.
- Có nhận diện chuẩn Bluebook không?
- Có — chuẩn Bluebook bản 21, ALWD Guide, OSCOLA (UK), McGill Guide (Canada), AGLC (Australia). Định dạng citation được tự phát hiện dựa trên reference có sẵn. Trích dẫn đúng thì loại khỏi điểm tổng. Trích dẫn sai chuẩn đánh dấu riêng — không coi là đạo văn mà là cần sửa chuẩn citation trước khi nộp.
- Tài liệu discovery được bảo vệ có xử lý được không?
- Tự lưu trữ engine trong nội bộ — Apache 2.0 + Docker. Tài liệu discovery dưới protective order, bản ghi sealed, chứng cứ bí mật không nên gửi lên cloud của bất kỳ bên nào. Tự lưu trữ nghĩa là “không bao giờ rời khỏi VPC” — không phải “tin cloud của chúng tôi”. Công ty làm kiện tụng lớn đều dùng cách này.
- Detector AI này có đủ để vượt qua hearing về hình phạt?
- AI detection sắp ra mắt — đã lên lộ trình, chưa có lúc đầu — nhưng phương pháp thì công khai (Binoculars, Hans et al. 2024, peer-reviewed). Từng đoạn đánh dấu đều ghi lại mã engine và snapshot data. Có thể chạy lại cùng commit để xác thực verdict. Detector AI nguồn đóng không làm được — tòa có nơi đã loại trừ vì không review được (loại Daubert). Công cụ của chúng tôi mở phương pháp; không khẳng định verdict hoàn hảo, nhưng bảo vệ được.
- Giá cho công ty 40 luật sư?
- Premium $79/tháng cho mỗi luật sư, tối đa 5.000 chữ/lần, 5.000 tài liệu/tháng, REST API + tích hợp LMS. Công ty cần duyệt discovery số lớn (10.000+ tài liệu/tháng), Enterprise thương lượng theo số liệu + hạ tầng riêng. Không tính chỗ ngồi, giá theo khối lượng.
- Có tích hợp với hệ quản lý tài liệu (iManage, NetDocuments, OpenText) không?
- Gói Pro+ cung cấp tích hợp webhook và REST API. iManage và NetDocuments đều hỗ trợ webhook gửi đi khi lưu tài liệu; cấu hình webhook để POST đến /v1/checks; báo cáo sẽ được đính kèm vào tài liệu dưới dạng trường metadata. OpenText eDOCS hỗ trợ tương tự thông qua Content Server hooks. Các script tích hợp mẫu cho cả ba hệ thống có tại github.com/NoplagLabs/noplag-engine/integrations.
- ediscovery — kiểm tra tài liệu đã nộp có được không?
- Khác kiểm tra bản ghi — ediscovery là phân loại tài liệu (phản hồi/từ chối/bảo mật) hơn là check đạo văn bản ghi của Sie. Noplag không phải công cụ review ediscovery (Relativity, Everlaw, Disco mạnh phần này). Nhưng nếu kiểm tra bản trả lời discovery do nội bộ Sie soạn có nguyên gốc, không có AI, thì Noplag phù hợp.
Chạy bản ghi qua công cụ. Trước khi nộp e-file.
Thả bản ghi hoặc motion vào. Nhận báo cáo đoạn theo đoạn kèm xác thực citation, phát hiện vụ án ảo, chỉ số AI. Miễn phí tới 2.500 chữ; bản Pro theo khối lượng công ty; Enterprise cho tự lưu trữ + hạ tầng riêng.