Trùng lặp, gộp hồ sơ công bố khoa học trong CSDL đơn vị: nguyên nhân và quy trình xử lý
Trùng lặp hồ sơ trong CSDL khoa học là tình trạng cùng một công bố hoặc cùng một nhà khoa học tồn tại dưới nhiều bản ghi khác nhau trong cơ sở dữ liệu nội bộ của đơn vị, do nhiều đầu mối cùng nhập liệu mà không đối chiếu theo mã định danh duy nhất. Hậu quả trực tiếp: tổng số công bố báo cáo lên Bộ bị đếm cao hơn thực tế, và nghiêm trọng hơn — giờ nghiên cứu hoặc kinh phí khoán chi có thể bị tính hai lần cho cùng một công trình liên khoa. Xử lý đòi hỏi quy trình rà soát định kỳ dựa trên mã định danh (DOI, ORCID, Scopus Author ID), không dựa vào tên hiển thị.
Cập nhật: tháng 9/2026 — Biên soạn bởi đội ngũ Scibase, Metis JSC
Trùng lặp hồ sơ CSDL khoa học là gì?
Trùng lặp hồ sơ CSDL khoa học là hiện tượng một thực thể dữ liệu duy nhất — một công bố khoa học hoặc một nhà khoa học — bị hệ thống hoặc người nhập liệu tạo thành từ hai bản ghi trở lên, do thiếu cơ chế đối chiếu bằng mã định danh khi khai báo.
Vấn đề này xảy ra ở hai lớp dữ liệu khác nhau, cần phân biệt rõ vì cách xử lý không giống nhau:
- Trùng bản ghi công bố (duplicate publication record): cùng một bài báo, đề tài hoặc sáng chế được khai báo nhiều lần trong hệ thống — phổ biến nhất khi công trình có đồng tác giả thuộc nhiều khoa/phòng và mỗi bên tự khai báo độc lập.
- Trùng hồ sơ nhà khoa học (duplicate person record): cùng một người có hai tài khoản hoặc hai hồ sơ trong CSDL nội bộ, thường do lỗi chính tả, viết tên có/không dấu khác nhau, hoặc đổi email khi chuyển đơn vị công tác.
Khác với trùng tên tác giả trên Scopus — nơi vấn đề nằm ở thuật toán của cơ sở dữ liệu quốc tế nhầm lẫn giữa hai người khác nhau — trùng lặp trong CSDL nội bộ là vấn đề quản trị dữ liệu của chính đơn vị, hoàn toàn nằm trong tầm kiểm soát của phòng KH&CN nếu có quy trình đúng ngay từ khâu nhập liệu.
Vì sao trùng lặp dữ liệu phổ biến trong CSDL khoa học tại Việt Nam?
Ba nguyên nhân kỹ thuật và quy trình dẫn đến trùng lặp lặp lại ở hầu hết đơn vị đang quản lý dữ liệu phân tán:
- Nhiều khoa/phòng cùng khai báo một công bố liên kết: một bài báo có tác giả thuộc Khoa A và đồng tác giả thuộc Khoa B — nếu hệ thống không đối chiếu theo DOI, cả hai khoa đều tự khai và bài báo xuất hiện hai lần khi tổng hợp toàn trường.
- Nhập lại dữ liệu lịch sử từ nhiều nguồn không đồng bộ: đơn vị chuyển đổi từ Excel sang hệ thống mới thường nhập cả dữ liệu cũ lẫn dữ liệu import tự động từ Scopus hoặc ORCID cho cùng một giai đoạn, tạo ra hai bản ghi cho cùng một công bố nếu không rà soát trước khi nhập — cùng loại rủi ro với việc nhập hồ sơ nhà khoa học hàng loạt từ Excel khi ghép file từ nhiều nguồn nhân sự khác nhau mà không đối chiếu khóa định danh trước.
- Sáp nhập, đổi tên đơn vị nội bộ: khi một khoa được sáp nhập hoặc đổi tên, hồ sơ nhà khoa học cũ (gắn đơn vị cũ) và hồ sơ mới (gắn đơn vị sau sáp nhập) đôi khi được tạo song song thay vì cập nhật lịch sử công tác trên cùng một hồ sơ — cùng nguyên nhân với việc tạo hồ sơ trùng khi một người chuyển công tác hoặc nghỉ hưu mà đơn vị mới không đối chiếu mã định danh trước khi tạo hồ sơ.
Đây là hệ quả trực tiếp của cách vận hành dữ liệu phân tán đã được phân tích trong bài 10 sai lầm khi quản lý dữ liệu khoa học bằng Excel — trong đó "nhập trùng công bố ở nhiều file khác nhau" đứng đầu danh sách. Vấn đề không biến mất khi chuyển sang hệ thống CSDL tập trung nếu hệ thống đó vẫn cho phép nhập liệu tự do mà không có cơ chế cảnh báo trùng theo mã định danh.
Theo khảo sát của Cục Thông tin Khoa học và Công nghệ Quốc gia (2024), hơn 72% đơn vị nghiên cứu tại Việt Nam vẫn dùng Excel hoặc Google Sheets làm công cụ chính quản lý dữ liệu nhà khoa học và công bố — môi trường mà mỗi khoa/phòng giữ một file riêng chính là điều kiện thuận lợi nhất để phát sinh trùng lặp khi tổng hợp toàn đơn vị.
Quy mô đội ngũ nghiên cứu càng lớn, xác suất trùng lặp càng cao. Theo báo cáo thống kê giáo dục đại học năm học 2023–2024 của Bộ Giáo dục và Đào tạo, cả nước có 88.031 giảng viên cơ hữu, trong đó 28.862 người có trình độ tiến sĩ — với quy mô này, hợp tác nghiên cứu liên khoa, liên viện là tất yếu, và mỗi hợp tác liên khoa không có quy tắc khai báo rõ ràng đều là một điểm rủi ro trùng lặp tiềm ẩn.
Hậu quả cụ thể khi dữ liệu công bố bị trùng lặp
Trùng lặp không chỉ là con số báo cáo "xấu xí" — nó kéo theo rủi ro có thể đo đếm được ở ba cấp độ, và cấp độ thứ ba thường bị đánh giá thấp nhất.
Cấp độ báo cáo thống kê. Tổng số công bố, số bài ISI/Scopus của đơn vị bị đếm cao hơn thực tế khi tổng hợp báo cáo KH&CN định kỳ gửi Bộ. Sai số này thường không lộ ra ở cấp một khoa, chỉ xuất hiện khi tổng hợp toàn trường và đối chiếu chéo giữa các đơn vị thành viên — rủi ro càng lớn khi số công bố Scopus của khối đại học Việt Nam đã tăng từ 8.958 bài năm 2018 lên 19.441 bài năm 2023 theo số liệu của Bộ Giáo dục và Đào tạo, kéo theo khối lượng bản ghi cần đối chiếu tăng tương ứng.
Cấp độ lưu trữ và truy vết. Theo Nghị định 174/2016/NĐ-CP, tài liệu làm căn cứ chi (trong đó có bảng kê giờ nghiên cứu, minh chứng công bố) phải lưu tối thiểu 5–10 năm. Nếu dữ liệu trùng lặp không được gộp và ghi log ngay khi phát hiện, đơn vị sẽ phải đối chiếu lại nhiều kỳ báo cáo cũ trong toàn bộ khoảng thời gian lưu trữ đó khi có yêu cầu thanh tra — công việc gần như bất khả thi nếu chỉ dựa vào file Excel rời rạc.
Cấp độ tính khối lượng nghiên cứu. Đây là hậu quả nghiêm trọng nhất về mặt tài chính: nếu một công bố liên khoa bị khai báo hai lần ở hai đơn vị, hệ thống quy đổi có thể tính giờ nghiên cứu hoặc điểm công trình hai lần cho cùng một sản phẩm, trong khi đúng quy định chỉ được phân bổ giờ nghiên cứu theo tỷ lệ đóng góp giữa các đơn vị đồng tác giả. Với đề tài áp dụng cơ chế khoán chi, tính trùng khối lượng nghiên cứu kéo theo rủi ro chi vượt định mức mà kiểm toán có thể xác định là khoản chi không hợp lệ khi đối chiếu lại — cùng dạng rủi ro với các lỗi bị xuất toán đã nêu trong bài thanh quyết toán kinh phí đề tài khoa học.
Cấp độ niềm tin dữ liệu. Khi thanh tra hoặc kiểm toán đối chiếu số liệu báo cáo với hồ sơ gốc và phát hiện chênh lệch do trùng lặp, đơn vị phải giải trình lại toàn bộ quy trình tổng hợp — tốn thời gian và ảnh hưởng uy tín của bộ phận quản lý KH&CN, kể cả khi nguyên nhân chỉ là lỗi kỹ thuật không cố ý.
Ba tình huống trùng lặp thường gặp và cách phân biệt
| Tình huống | Dấu hiệu nhận biết | Cách xử lý đúng |
|---|---|---|
| Trùng bản ghi công bố liên khoa | Cùng tiêu đề, cùng DOI xuất hiện ở nhiều đơn vị con | Gộp về một bản ghi gốc, gắn nhiều đơn vị/tác giả vào cùng bản ghi đó |
| Trùng hồ sơ nhà khoa học do lỗi nhập tên | Hai tài khoản, mỗi tài khoản có một phần công bố của cùng một người | Gộp hồ sơ, giữ lại một mã định danh nội bộ duy nhất, chuyển toàn bộ công bố về hồ sơ chính |
| Trùng do nhập lại dữ liệu lịch sử từ hai nguồn | Một bản ghi có DOI đầy đủ (từ import Scopus), một bản ghi thiếu DOI (khai tay từ Excel cũ) | Đối chiếu DOI/tiêu đề, giữ bản ghi có nhiều thông tin nhất, xoá bản ghi thiếu sau khi xác nhận trùng |
Phân biệt đúng loại trùng lặp quan trọng vì cách gộp khác nhau: gộp bản ghi công bố không được làm mất thông tin đồng tác giả của bất kỳ đơn vị nào tham gia, còn gộp hồ sơ nhà khoa học phải giữ nguyên toàn bộ lịch sử công tác qua các đơn vị mà người đó từng thuộc về.
Quy trình 5 bước rà soát và xử lý trùng lặp trong CSDL đơn vị
- Kiểm kê định kỳ theo mã định danh: chạy đối chiếu toàn bộ bản ghi công bố theo DOI và hồ sơ nhà khoa học theo ORCID/Scopus Author ID, không đối chiếu theo tên hiển thị — tên tiếng Việt có/không dấu là nguồn gây trùng lặp giả nhiều nhất.
- Lập danh sách nghi vấn trùng lặp: xuất báo cáo các cặp bản ghi có DOI giống nhau, hoặc hồ sơ có cùng số điện thoại/email nhưng khác tên hiển thị.
- Xác minh trước khi gộp: đối chiếu với minh chứng gốc (bản PDF công bố, quyết định phê duyệt đề tài) để chắc chắn hai bản ghi thực sự là một, tránh gộp nhầm hai công bố khác nhau chỉ vì tiêu đề tương tự.
- Gộp bản ghi và giữ lịch sử chỉnh sửa: thao tác gộp phải ghi log đầy đủ — bản ghi nào bị gộp vào bản ghi nào, ai thực hiện, thời điểm nào — để có thể truy vết khi cần giải trình sau này.
- Chuẩn hoá quy định khai báo từ gốc: ban hành quy định nội bộ yêu cầu công bố liên khoa chỉ được khai báo một lần bởi tác giả đứng đầu hoặc đơn vị chủ trì, các đơn vị đồng tác giả khác chỉ "liên kết" vào bản ghi đã có thay vì tạo bản ghi mới.
Bước 5 là bước phòng ngừa quan trọng nhất — xử lý trùng lặp sau khi đã phát sinh luôn tốn thời gian hơn nhiều so với thiết kế quy trình khai báo đúng ngay từ đầu, tương tự nguyên tắc đã nêu trong kinh nghiệm chuyển đổi từ Excel sang hệ thống CSDL tập trung.
So sánh: rà soát trùng lặp thủ công trên Excel và cơ chế cảnh báo tự động
| Tiêu chí | Rà soát thủ công (Excel) | Hệ thống có cảnh báo trùng tự động |
|---|---|---|
| Thời điểm phát hiện | Thường chỉ phát hiện khi tổng hợp báo cáo cuối kỳ | Ngay tại thời điểm nhập liệu, trước khi lưu bản ghi |
| Căn cứ đối chiếu | Chủ yếu dựa vào tên bài, tên tác giả (dễ sai do viết khác nhau) | Đối chiếu theo DOI, ORCID, mã định danh nội bộ |
| Công sức cần bỏ ra | Tỷ lệ thuận với số lượng file và số khoa/phòng tham gia nhập liệu | Tự động, không tăng theo quy mô dữ liệu |
| Rủi ro bỏ sót | Cao, đặc biệt với đơn vị trên 100 nhà khoa học | Thấp hơn đáng kể nhờ đối chiếu toàn bộ cơ sở dữ liệu mỗi lần nhập mới |
| Khả năng truy vết sau gộp | Hầu như không có, trừ khi ghi chú thủ công | Có log lịch sử đầy đủ cho từng lần gộp |
Chênh lệch rõ nhất nằm ở thời điểm phát hiện: rà soát thủ công luôn là hành động "dọn dẹp sau", trong khi cơ chế cảnh báo tự động ngăn trùng lặp phát sinh ngay từ bước nhập liệu đầu tiên — khác biệt quyết định vì phần lớn chi phí xử lý trùng lặp nằm ở công đoạn xác minh và đối chiếu ngược, không phải thao tác gộp.
Tình huống thực tế: công bố liên khoa bị tính trùng khi quyết toán giờ nghiên cứu
Tình huống minh hoạ dựng theo mô-típ phổ biến trong thực tế triển khai CSDL tại các trường đa khoa (ví dụ giả định, không phải trường hợp cụ thể của đơn vị nào): một bài báo Q1 có ba tác giả thuộc Khoa Hoá, Khoa Sinh và Viện Nghiên cứu liên ngành của cùng một trường. Vì hệ thống CSDL của trường cho phép mỗi đơn vị tự khai báo công bố độc lập, cả ba đơn vị đều khai báo bài báo này vào cuối năm để tính khối lượng nghiên cứu cho giảng viên của mình.
Đến khi phòng KH&CN tổng hợp để duyệt khoán chi giờ nghiên cứu vượt định mức, hệ thống ghi nhận ba lượt tính điểm công trình cho một bài báo duy nhất — thay vì phân bổ tỷ lệ đóng góp giữa ba tác giả theo đúng quy định. Sai lệch chỉ được phát hiện khi kế toán đối chiếu tổng kinh phí chi trả giờ nghiên cứu vượt định mức với số bài báo Q1 thực tế của toàn trường trong năm, thấy chênh lệch bất thường.
Cách xử lý: phòng KH&CN rà soát lại toàn bộ công bố có từ hai đơn vị đồng tác giả trở lên trong năm đó bằng cách đối chiếu DOI, gộp về đúng một bản ghi gốc có gắn danh sách đầy đủ tác giả và đơn vị, sau đó tính lại giờ nghiên cứu theo đúng tỷ lệ đóng góp. Sau sự việc, trường ban hành quy định: công bố liên khoa chỉ được đơn vị của tác giả chịu trách nhiệm chính (corresponding author) khai báo gốc, các đơn vị còn lại chỉ xác nhận liên kết.
Checklist áp dụng ngay cho phòng KH&CN
- [ ] Có quy định rõ: ai được khai báo gốc một công bố liên khoa, ai chỉ được liên kết vào bản ghi đã có
- [ ] Chạy đối chiếu DOI toàn bộ cơ sở dữ liệu ít nhất mỗi quý, không chỉ vào cuối năm trước hạn báo cáo
- [ ] Yêu cầu mọi hồ sơ nhà khoa học khai báo ORCID hoặc mã định danh nội bộ duy nhất khi tạo tài khoản
- [ ] Trước khi tính khối lượng nghiên cứu hoặc duyệt khoán chi, đối chiếu xem công bố có tác giả thuộc nhiều đơn vị đã được phân bổ đúng tỷ lệ hay đang bị tính trùng
- [ ] Lưu log đầy đủ mỗi lần gộp hoặc xoá bản ghi trùng, ghi rõ người thực hiện và căn cứ xác minh
- [ ] Khi sáp nhập hoặc đổi tên đơn vị nội bộ, cập nhật lịch sử công tác trên hồ sơ hiện có thay vì tạo hồ sơ mới
Vai trò của hệ thống CSDL trong việc ngăn trùng lặp từ gốc
Với đơn vị có hàng trăm nhà khoa học và nhiều khoa/phòng cùng nhập liệu, ngăn trùng lặp từ gốc hiệu quả hơn nhiều so với dọn dẹp sau khi đã phát sinh. Hệ thống CSDL khoa học và công nghệ giải quyết vấn đề này bằng cách bắt buộc mọi công bố và mọi hồ sơ nhà khoa học gắn với một mã định danh duy nhất ngay từ khi khai báo, thay vì cho phép nhập tự do rồi mới đối chiếu.
Trên Scibase, khi một nhà khoa học khai báo công bố có đồng tác giả thuộc đơn vị khác trong cùng hệ thống, công cụ cảnh báo trùng lặp kiểm tra theo DOI ngay tại thời điểm nhập liệu và gợi ý liên kết vào bản ghi đã tồn tại thay vì tạo bản ghi mới — cơ chế đối chiếu nhiều lớp (DOI chính xác, tiêu đề theo độ tương đồng, tác giả theo mã định danh) đứng sau tính năng này được phân tích chi tiết tại bài ứng dụng công nghệ trong quy trình xét duyệt nội bộ: phát hiện trùng lặp, cảnh báo minh chứng tự động. Mọi thao tác gộp hoặc chỉnh sửa đều được ghi lại trong lịch sử chỉnh sửa của từng công bố, giúp phòng KH&CN truy vết khi cần giải trình với thanh tra hoặc kiểm toán. Đây cũng là tiêu chí nên đưa vào khi đơn vị đánh giá phần mềm, như đã nêu trong tiêu chí chọn phần mềm CSDL khoa học và công nghệ.
Câu hỏi thường gặp
Trùng lặp hồ sơ CSDL nội bộ khác trùng tên tác giả trên Scopus thế nào?
Trùng lặp trong CSDL nội bộ là vấn đề dữ liệu do chính đơn vị kiểm soát, xảy ra khi nhiều bộ phận cùng khai báo mà không đối chiếu mã định danh. Trùng tên tác giả trên Scopus là lỗi thuật toán của cơ sở dữ liệu quốc tế nhầm lẫn hai người khác nhau — xem chi tiết tại bài trùng tên tác giả trong công bố khoa học. Hai vấn đề độc lập, có thể xảy ra đồng thời trên cùng một nhà khoa học.
Vì sao công bố liên khoa dễ bị tính trùng khi quyết toán giờ nghiên cứu?
Vì mỗi khoa thường coi công bố có tên giảng viên của mình là "công bố của khoa mình" và tự khai báo độc lập, trong khi đúng quy định giờ nghiên cứu phải được phân bổ theo tỷ lệ đóng góp giữa các đơn vị đồng tác giả, không được mỗi đơn vị tính đủ 100% khối lượng của cùng một công trình.
Gộp bản ghi trùng có làm mất lịch sử chỉnh sửa hoặc minh chứng đã đính kèm không?
Nếu thực hiện đúng quy trình, không mất. Bản ghi gốc giữ lại toàn bộ minh chứng, và thao tác gộp chỉ chuyển hướng các bản ghi trùng khác trỏ về bản ghi gốc kèm log ghi rõ lịch sử gộp — khác với việc xoá thẳng bản ghi trùng mà không lưu vết.
Ai nên có quyền gộp hoặc xoá bản ghi trùng trong hệ thống CSDL?
Nên giới hạn quyền này cho quản trị viên cấp đơn vị hoặc cán bộ phòng KH&CN được phân công, không nên để mọi nhà khoa học tự gộp hồ sơ của người khác — tương tự nguyên tắc phân quyền quản lý dữ liệu khoa học theo cấp đã áp dụng cho các thao tác nhạy cảm khác trong hệ thống.
Đơn vị dưới 50 nhà khoa học có cần lo về trùng lặp dữ liệu không?
Rủi ro thấp hơn nhưng không bằng không — trùng lặp vẫn có thể xảy ra nếu đơn vị nhỏ có hợp tác nghiên cứu liên ngành với đơn vị khác trong cùng trường lớn hơn, hoặc khi nhập lại dữ liệu lịch sử từ nhiều nguồn. Quy mô nhỏ giúp rà soát thủ công dễ hơn, nhưng thói quen đối chiếu theo mã định danh vẫn nên áp dụng ngay từ đầu.
Trùng lặp dữ liệu có thể bị coi là gian lận khi thanh tra không?
Thông thường không, vì phần lớn trường hợp là lỗi kỹ thuật do quy trình khai báo phân tán, không phải cố ý khai khống. Tuy nhiên nếu đơn vị không có khả năng giải trình nguyên nhân và không sửa được số liệu khi được yêu cầu, tình huống có thể bị diễn giải bất lợi hơn — nên chủ động lưu log gộp bản ghi để sẵn sàng giải trình.
Có nên xoá hẳn bản ghi trùng thay vì gộp không?
Không nên xoá thẳng nếu bản ghi trùng đã từng được dùng trong báo cáo hoặc quyết toán trước đó — nên gộp và giữ lại dưới dạng bản ghi đã hợp nhất (merged), để vẫn truy vết được nếu sau này cần đối chiếu lại số liệu của các kỳ báo cáo cũ.
Tóm tắt
- Trùng lặp hồ sơ CSDL khoa học gồm hai loại: trùng bản ghi công bố (do nhiều khoa cùng khai) và trùng hồ sơ nhà khoa học (do lỗi nhập tên).
- Nguyên nhân chính: khai báo phân tán theo từng khoa/phòng, nhập lại dữ liệu lịch sử từ nhiều nguồn không đồng bộ, sáp nhập/đổi tên đơn vị.
- Hậu quả nghiêm trọng nhất là tính trùng khối lượng nghiên cứu hoặc kinh phí khoán chi cho cùng một công trình liên khoa — rủi ro tài chính cụ thể khi kiểm toán.
- Quy trình xử lý gồm 5 bước: kiểm kê theo mã định danh, lập danh sách nghi vấn, xác minh, gộp có lưu log, chuẩn hoá quy định khai báo từ gốc.
- Hệ thống CSDL có cơ chế cảnh báo trùng tự động theo DOI/ORCID ngăn vấn đề từ gốc, hiệu quả hơn nhiều so với rà soát thủ công sau khi đã phát sinh.
Nguồn tham khảo: khảo sát của Cục Thông tin Khoa học và Công nghệ Quốc gia (2024) về thực trạng quản lý dữ liệu khoa học; báo cáo thống kê giáo dục đại học năm học 2023–2024 và số liệu công bố Scopus của Bộ Giáo dục và Đào tạo; Nghị định 174/2016/NĐ-CP về lưu trữ tài liệu kế toán; Thông tư liên tịch 27/2015/TTLT-BKHCN-BTC về khoán chi thực hiện nhiệm vụ khoa học và công nghệ; kinh nghiệm triển khai hệ thống CSDL khoa học và công nghệ cho các trường đại học, viện nghiên cứu tại Việt Nam. Biên soạn bởi đội ngũ Scibase — Metis JSC.
Bài viết liên quan
- DOI là gì? Vai trò của DOI và Crossref trong quản lý công bố khoa học
- 10 sai lầm khi quản lý dữ liệu khoa học bằng Excel và cách khắc phục
- Trùng tên tác giả trong công bố khoa học: Nguyên nhân, rủi ro và cách xử lý
- Cách phân bổ giờ nghiên cứu khi một công trình có nhiều tác giả thuộc nhiều đơn vị
- Từ Excel đến hệ thống CSDL khoa học tập trung — Kinh nghiệm số hoá
- Ứng dụng công nghệ trong quy trình xét duyệt nội bộ: Phát hiện trùng lặp, cảnh báo minh chứng tự động
- Tính năng chính của Scibase
- Liên hệ triển khai Scibase
