Skip to content

Tích hợp CSDL khoa học và công nghệ với hệ thống hiện có của đơn vị: kiến trúc API và luồng dữ liệu ​

Tích hợp CSDL khoa học và công nghệ là việc kết nối hệ thống quản lý dữ liệu nghiên cứu với các hệ thống nội bộ khác của đơn vị — nhân sự (HRMS), đào tạo (LMS), thư viện số, cổng thông tin công khai, đăng nhập tập trung (SSO) — để dữ liệu chỉ nhập một lần ở hệ thống "chủ" rồi tự động đồng bộ, thay vì nhập tay song song ở nhiều nơi. Ba cơ chế kỹ thuật phổ biến nhất là REST API, webhook (đồng bộ theo sự kiện) và batch sync (đồng bộ theo lô, thường chạy đêm). Bài viết trình bày kiến trúc tích hợp, luồng dữ liệu theo từng hệ thống, rủi ro bảo mật và checklist cụ thể trước khi đưa yêu cầu tích hợp vào hợp đồng phần mềm.

Cập nhật: tháng 9/2026 — Biên soạn bởi đội ngũ Scibase, Metis JSC


Tích hợp CSDL khoa học và công nghệ qua API nghĩa là gì? ​

Tích hợp qua API là việc hai hệ thống phần mềm trao đổi dữ liệu tự động thông qua một giao diện lập trình được chuẩn hóa, thay vì con người xuất file từ hệ thống này rồi nhập tay vào hệ thống kia. Trong bối cảnh CSDL khoa học và công nghệ, điều này thường có nghĩa: hệ thống nhân sự của đơn vị vẫn là nơi tạo hồ sơ cán bộ đầu tiên, nhưng thông tin đó tự động chảy sang hệ thống quản lý khoa học mà không cần cán bộ phòng Quản lý khoa học nhập lại.

API (Application Programming Interface) là tập hợp quy tắc cho phép một phần mềm gọi chức năng hoặc lấy dữ liệu của phần mềm khác một cách có kiểm soát, thông qua địa chỉ và định dạng dữ liệu đã thống nhất trước — phổ biến nhất hiện nay là REST API trao đổi dữ liệu dạng JSON.

Điều cần phân biệt ngay từ đầu: tích hợp API nội bộ (kết nối CSDL khoa học với HRMS, LMS, thư viện số của chính đơn vị) khác với liên thông dữ liệu lên Cơ sở dữ liệu quốc gia về khoa học và công nghệ do Bộ Khoa học và Công nghệ quản lý. Bài đó nói về nghĩa vụ báo cáo ra bên ngoài; bài này nói về cách các hệ thống bên trong đơn vị nói chuyện với nhau — hai việc cùng cần API nhưng phục vụ mục đích khác nhau, và một đơn vị làm tốt tích hợp nội bộ thường liên thông ra ngoài dễ hơn nhiều vì dữ liệu đã sạch và có định danh nhất quán.


Vì sao cần tích hợp thay vì nhập liệu song song ở nhiều hệ thống? ​

Không tích hợp không có nghĩa là không làm được việc — phần lớn đơn vị Việt Nam vẫn vận hành ổn với việc nhập tay. Vấn đề là chi phí ẩn tăng dần theo quy mô và số lượng hệ thống.

Theo khảo sát của Cục Thông tin Khoa học và Công nghệ Quốc gia (2024), hơn 72% đơn vị nghiên cứu tại Việt Nam vẫn quản lý dữ liệu chính bằng Excel hoặc Google Sheets — một phần lớn trong số đó đồng thời vận hành ít nhất ba hệ thống rời rạc (nhân sự, đào tạo, quản lý khoa học) mà không có kết nối giữa chúng. Hệ quả thường gặp:

  • Sai lệch danh sách cán bộ — hệ thống nhân sự đã cập nhật một người nghỉ việc hoặc chuyển đơn vị, nhưng CSDL khoa học vẫn tính giờ nghiên cứu cho người đó vì không ai nhớ cập nhật tay.
  • Trùng lặp công sức nhập liệu — cùng thông tin học vị, chức danh khoa học phải nhập cả ở hệ thống nhân sự lẫn hồ sơ khoa học, dễ lệch nhau theo thời gian.
  • Chậm cập nhật thống kê công khai — cổng thông tin công khai của đơn vị hiển thị số liệu công bố cũ vì phải chờ ai đó xuất báo cáo rồi cập nhật tay lên trang web.

Theo Báo cáo điều tra vi phạm dữ liệu (Data Breach Investigations Report) 2024 của Verizon — phân tích 10.626 vụ vi phạm dữ liệu xác nhận trong năm 2023 — 68% số vụ liên quan đến yếu tố con người không cố ý, phần lớn là thao tác nhập liệu hoặc xử lý dữ liệu thủ công sai sót. Tự động hóa luồng dữ liệu giữa các hệ thống không loại bỏ hoàn toàn rủi ro này, nhưng thu hẹp đáng kể số điểm chạm mà con người phải nhập tay.


Những hệ thống nào thường cần kết nối với CSDL khoa học và công nghệ? ​

Không phải đơn vị nào cũng cần tích hợp với tất cả các hệ thống dưới đây — mức độ cần thiết phụ thuộc quy mô và số lượng hệ thống đang vận hành song song.

Hệ thốngDữ liệu trao đổiChiều đồng bộ phổ biến
Hệ thống nhân sự (HRMS)Hồ sơ cán bộ, chức danh, đơn vị công tác, ngày bắt đầu/kết thúcHRMS → CSDL khoa học
Hệ thống đào tạo (LMS)Danh sách nghiên cứu sinh, sinh viên nghiên cứu khoa học, người hướng dẫnLMS ↔ CSDL khoa học (hai chiều)
Thư viện số / cơ sở dữ liệu trích dẫnĐối chiếu công bố với Scopus, Web of Science để giảm sai sót tính điểmCSDL trích dẫn → CSDL khoa học
Cổng thông tin công khai của đơn vịThống kê công bố, hồ sơ nhà khoa học hiển thị công khaiCSDL khoa học → Cổng thông tin
Đăng nhập tập trung (SSO/LDAP)Xác thực tài khoản, không đồng bộ dữ liệu nghiệp vụCSDL khoa học đọc từ SSO khi đăng nhập
Hệ thống liên thông quốc gia (NASATI)Nhiệm vụ KH&CN, kết quả nghiên cứu theo mẫu báo cáoCSDL khoa học → Hệ thống quốc gia

Trong bảng trên, hệ thống nhân sự gần như luôn nên là nguồn dữ liệu "chủ" cho thông tin cán bộ — vì đây là nơi thông tin lao động chính thức (hợp đồng, ngày nghỉ việc) được cập nhật đầu tiên và có giá trị pháp lý. Nếu CSDL khoa học tự cho phép sửa tay các trường trùng với HRMS mà không đồng bộ, hai hệ thống sẽ lệch nhau chỉ sau vài tháng.


Kiến trúc tích hợp: point-to-point hay qua middleware? ​

Có hai mô hình kiến trúc chính, khác nhau rõ rệt về chi phí bảo trì khi số lượng hệ thống tăng lên.

Mô hìnhCách hoạt độngƯu điểmNhược điểm
Point-to-pointMỗi cặp hệ thống kết nối trực tiếp với nhau bằng API riêngTriển khai nhanh, dễ hiểu khi chỉ có 2-3 hệ thốngSố kết nối tăng theo cấp số nhân khi thêm hệ thống mới; mỗi lần một hệ thống đổi API phải sửa lại tất cả kết nối liên quan
Middleware / iPaaSTất cả hệ thống kết nối qua một tầng trung gian (integration platform), tầng này định tuyến và chuyển đổi dữ liệuThêm hệ thống mới chỉ cần một kết nối tới middleware, không ảnh hưởng các kết nối khácChi phí đầu tư ban đầu cao hơn, cần năng lực vận hành tầng trung gian

Với đơn vị chỉ cần kết nối 2-3 hệ thống (ví dụ HRMS và CSDL khoa học), point-to-point vẫn là lựa chọn thực dụng. Ngưỡng nên cân nhắc chuyển sang middleware là khi đơn vị đã hoặc dự kiến kết nối từ 4 hệ thống trở lên — lúc đó số lượng kết nối point-to-point (tính theo công thức n×(n-1)/2) bắt đầu vượt quá khả năng bảo trì của một đội IT nhỏ.

Nguyên tắc thiết kế quan trọng nhất không nằm ở việc chọn mô hình nào, mà ở việc xác định rõ hệ thống nào là "chủ" (master) của từng loại dữ liệu. Nếu hai hệ thống cùng cho phép sửa một trường dữ liệu mà không có quy tắc ai thắng khi xung đột, dữ liệu sẽ trôi dạt (data drift) theo thời gian dù kiến trúc kỹ thuật có tốt đến đâu.


Batch sync, webhook hay đồng bộ thời gian thực? ​

Ba cơ chế đồng bộ dữ liệu phổ biến, mỗi cơ chế phù hợp với một loại dữ liệu khác nhau.

  1. Batch sync (đồng bộ theo lô) — hệ thống chạy tự động theo lịch cố định (thường vào ban đêm), lấy toàn bộ hoặc phần thay đổi của dữ liệu từ hệ thống nguồn rồi cập nhật vào hệ thống đích. Phù hợp với dữ liệu không cần cập nhật tức thì, ví dụ danh sách cán bộ từ HRMS.
  2. Webhook (đồng bộ theo sự kiện) — hệ thống nguồn chủ động gửi thông báo ngay khi có thay đổi (ví dụ: có công bố mới được duyệt), hệ thống đích nhận và xử lý ngay. Phù hợp với dữ liệu cần phản ánh gần thời gian thực, ví dụ cập nhật trạng thái xét duyệt công bố.
  3. Đồng bộ thời gian thực qua API trực tiếp — hệ thống đích gọi API của hệ thống nguồn ngay tại thời điểm cần dữ liệu, không lưu bản sao. Phù hợp với dữ liệu cần luôn chính xác tại thời điểm truy vấn, ví dụ kiểm tra trạng thái tài khoản khi đăng nhập qua SSO.

Sai lầm thường gặp là chọn webhook cho mọi loại dữ liệu vì nghĩ "thời gian thực luôn tốt hơn" — trên thực tế, webhook đòi hỏi cơ chế thử lại (retry) khi hệ thống đích tạm thời không phản hồi, và nếu không có cơ chế idempotency (đảm bảo xử lý một sự kiện nhiều lần vẫn cho kết quả giống hệt xử lý một lần), một webhook gọi lại do lỗi mạng có thể tạo ra bản ghi trùng lặp. Với dữ liệu như danh sách cán bộ, batch sync ban đêm đơn giản và ổn định hơn nhiều so với webhook thời gian thực.


Bảo mật khi tích hợp API: những nguyên tắc không thể bỏ qua ​

Mỗi kết nối API mới là một điểm truy cập mới vào dữ liệu của đơn vị — bao gồm dữ liệu cá nhân của nhà khoa học thuộc phạm vi điều chỉnh của Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân.

Theo Báo cáo chi phí vi phạm dữ liệu (Cost of a Data Breach Report) 2024 của IBM, chi phí trung bình toàn cầu cho một vụ vi phạm dữ liệu đạt 4,88 triệu USD trong năm 2024, trong đó cấu hình sai quyền truy cập góp phần gây ra 15% số vụ được khảo sát — một tỷ lệ đáng kể trong nhóm này bắt nguồn từ các kết nối API được cấp quyền rộng hơn mức cần thiết.

Bốn nguyên tắc nên áp dụng cho mọi kết nối API mới:

  • Giới hạn phạm vi (scope) theo nguyên tắc tối thiểu — API key hoặc token chỉ được cấp quyền đọc/ghi đúng những trường dữ liệu cần thiết cho mục đích tích hợp cụ thể, không cấp quyền toàn hệ thống cho tiện.
  • Xoay vòng (rotate) khóa API định kỳ — không dùng một khóa API cố định vĩnh viễn từ lúc triển khai, đặc biệt khi có nhân sự IT rời đơn vị.
  • Ghi log đầy đủ mọi lệnh gọi API — ai/hệ thống nào gọi, gọi gì, khi nào — để có căn cứ truy vết khi phát hiện dữ liệu bất thường, nhất quán với yêu cầu lưu vết thao tác đã nêu tại bài tiêu chí chọn phần mềm CSDL khoa học và công nghệ.
  • Xác thực bằng chuẩn đã kiểm chứng (OAuth 2.0, SAML cho SSO) thay vì tự thiết kế cơ chế xác thực riêng — tự thiết kế thường bỏ sót các trường hợp biên mà chuẩn đã xử lý sẵn.

Sai lầm thường gặp khi tích hợp CSDL khoa học tại đơn vị Việt Nam ​

Những lỗi dưới đây lặp lại ở nhiều đơn vị, không phụ thuộc nhà cung cấp phần mềm cụ thể nào.

  • Đồng bộ một chiều nhưng tưởng là hai chiều — HRMS cập nhật cán bộ nghỉ việc, nhưng chỉ đồng bộ thêm mới mà không đồng bộ xóa/ngừng hoạt động, khiến CSDL khoa học tiếp tục hiển thị và tính giờ nghiên cứu cho người đã rời đơn vị nhiều tháng.
  • Không thống nhất mã định danh giữa các hệ thống — HRMS dùng mã cán bộ nội bộ, CSDL khoa học dùng email làm khóa chính, hai hệ thống không có trường ánh xạ chung, dẫn đến tạo trùng hồ sơ khi một cán bộ đổi email.
  • Batch job đồng bộ trùng giờ với sao lưu (backup) hệ thống — cả hai tác vụ cùng chạy vào 2h sáng, gây tranh chấp tài nguyên hoặc đồng bộ dữ liệu ở trạng thái chưa hoàn chỉnh.
  • Không có cơ chế cảnh báo khi đồng bộ thất bại — batch job lỗi âm thầm trong nhiều tuần, không ai phát hiện cho đến khi báo cáo định kỳ bị sai số liệu.
  • Giao toàn bộ việc tích hợp cho nhà cung cấp mà không có ai phía đơn vị hiểu luồng dữ liệu — khi cần thay đổi nhỏ (ví dụ thêm một trường đồng bộ), đơn vị phải phụ thuộc hoàn toàn vào lịch làm việc của nhà cung cấp.

Checklist áp dụng ngay khi lập yêu cầu tích hợp ​

Trước khi đưa yêu cầu tích hợp vào phụ lục kỹ thuật hoặc hợp đồng với nhà cung cấp, xác nhận đã trả lời được các câu hỏi sau:

  1. Liệt kê đầy đủ hệ thống cần kết nối — HRMS, LMS, thư viện số, cổng thông tin, SSO — và mức độ ưu tiên của từng kết nối.
  2. Xác định hệ thống "chủ" cho từng loại dữ liệu — tránh tình trạng hai hệ thống cùng cho sửa một trường mà không có quy tắc ưu tiên.
  3. Chọn cơ chế đồng bộ phù hợp cho từng loại dữ liệu — batch sync cho dữ liệu ít thay đổi, webhook cho dữ liệu cần cập nhật gần thời gian thực.
  4. Yêu cầu nhà cung cấp cung cấp tài liệu API (API documentation) đầy đủ, không chỉ lời hứa miệng "có thể tích hợp được".
  5. Kiểm tra cơ chế xác thực và giới hạn quyền truy cập của từng API key trước khi cấp cho hệ thống khác.
  6. Thống nhất mã định danh dùng chung giữa các hệ thống (mã cán bộ, email, hoặc ORCID) trước khi bắt đầu đồng bộ dữ liệu thật.
  7. Thiết lập cơ chế cảnh báo khi đồng bộ thất bại, không chỉ dựa vào việc người dùng tự phát hiện sai số liệu.
  8. Phân công rõ ai phía đơn vị chịu trách nhiệm hiểu và giám sát luồng dữ liệu sau khi triển khai, không giao khoán hoàn toàn cho nhà cung cấp.

Bước tiếp theo sau khi chốt yêu cầu tích hợp là đưa vào giai đoạn thiết kế giải pháp của dự án triển khai — xem chi tiết tại bài lộ trình triển khai hệ thống CSDL khoa học và công nghệ: từ khảo sát đến go-live.


Câu hỏi thường gặp ​

Tích hợp API có bắt buộc phải làm ngay từ lần triển khai đầu tiên không?

Không bắt buộc. Nhiều đơn vị bắt đầu với nhập liệu tay hoặc nhập từ file Excel xuất ra từ HRMS, sau đó bổ sung tích hợp API khi khối lượng dữ liệu hoặc tần suất thay đổi tăng lên. Điều quan trọng là chọn phần mềm CSDL khoa học có hỗ trợ sẵn API ngay từ đầu, để không phải thay hệ thống khi cần tích hợp về sau.

Chi phí tích hợp API có tính riêng ngoài hợp đồng phần mềm không?

Thường có, vì mỗi lần tích hợp với một hệ thống cụ thể (HRMS, LMS) đòi hỏi công sức phân tích cấu trúc dữ liệu riêng của hệ thống đó. Nên yêu cầu nhà cung cấp báo giá riêng cho từng kết nối tích hợp, không gộp chung vào phí thuê bao phần mềm.

Đơn vị có cần đội IT riêng để duy trì các kết nối API không?

Không nhất thiết cần đội riêng, nhưng cần ít nhất một cán bộ IT hiểu đủ luồng dữ liệu để giám sát và báo lỗi kịp thời khi đồng bộ thất bại — tương tự vai trò điều phối đã nêu trong mô hình RACI tại bài lộ trình triển khai.

Tích hợp nội bộ có khác gì liên thông dữ liệu lên hệ thống quốc gia?

Có. Tích hợp nội bộ kết nối các hệ thống trong phạm vi đơn vị (HRMS, LMS, cổng thông tin), còn liên thông dữ liệu quốc gia là nghĩa vụ báo cáo bắt buộc lên Cơ sở dữ liệu quốc gia về khoa học và công nghệ theo Nghị định 11/2014/NĐ-CP. Tích hợp nội bộ tốt thường giúp việc liên thông quốc gia dễ dàng hơn vì dữ liệu đã sạch và nhất quán.

Webhook và batch sync khác nhau thế nào, nên chọn cái nào?

Webhook gửi thông báo ngay khi có thay đổi, phù hợp dữ liệu cần cập nhật gần thời gian thực như trạng thái xét duyệt công bố. Batch sync chạy theo lịch cố định, phù hợp dữ liệu ít thay đổi như danh sách cán bộ. Phần lớn đơn vị nên kết hợp cả hai theo từng loại dữ liệu, không chọn một cơ chế duy nhất cho toàn hệ thống.

Nếu hai hệ thống dùng mã định danh khác nhau cho cùng một cán bộ thì xử lý thế nào?

Cần tạo một bảng ánh xạ (mapping table) giữa hai mã định danh ngay khi bắt đầu tích hợp, thay vì cố gắng khớp bằng tên — khớp bằng tên dễ sai khi có trùng tên hoặc cán bộ đổi họ tên. Về lâu dài, nên thống nhất một định danh dùng chung, ưu tiên mã cán bộ nội bộ hoặc ORCID cho nhà khoa học.

Làm sao biết một kết nối API có đủ an toàn để triển khai không?

Kiểm tra ba điều tối thiểu: kết nối có dùng chuẩn xác thực đã kiểm chứng (OAuth 2.0, SAML) hay không, API key có giới hạn phạm vi quyền truy cập theo đúng nhu cầu hay không, và hệ thống có ghi log đầy đủ mọi lệnh gọi API hay không. Thiếu một trong ba là dấu hiệu cần yêu cầu nhà cung cấp bổ sung trước khi đưa vào vận hành thật.


Tóm tắt ​

  • Tích hợp CSDL khoa học qua API giúp dữ liệu chỉ nhập một lần ở hệ thống "chủ" rồi tự động đồng bộ, thay vì nhập tay song song ở nhiều nơi
  • Các hệ thống thường cần kết nối: nhân sự (HRMS), đào tạo (LMS), thư viện số/CSDL trích dẫn, cổng thông tin công khai, SSO, hệ thống liên thông quốc gia
  • Hai mô hình kiến trúc: point-to-point (đơn giản, phù hợp ít hệ thống) và middleware (phù hợp từ 4 hệ thống trở lên)
  • Ba cơ chế đồng bộ: batch sync (định kỳ), webhook (theo sự kiện), đồng bộ thời gian thực — chọn theo đặc điểm từng loại dữ liệu, không dùng một cơ chế cho tất cả
  • Bảo mật API cần giới hạn phạm vi quyền, xoay vòng khóa định kỳ, ghi log đầy đủ và dùng chuẩn xác thực đã kiểm chứng
  • Sai lầm phổ biến nhất: đồng bộ một chiều nhưng tưởng hai chiều, không thống nhất mã định danh, không có cảnh báo khi đồng bộ thất bại

Về nội dung bài viết

Bài viết được biên soạn bởi đội ngũ Scibase — Metis JSC, dựa trên kinh nghiệm tư vấn và triển khai hệ thống CSDL khoa học và công nghệ cho các viện, trường tại Việt Nam. Nội dung mang tính tham khảo kỹ thuật chung, áp dụng được với bất kỳ nhà cung cấp phần mềm nào.

Nguồn tham khảo: Cục Thông tin Khoa học và Công nghệ Quốc gia, khảo sát hiện trạng quản lý dữ liệu KH&CN (2024); IBM Cost of a Data Breach Report 2024; Verizon 2024 Data Breach Investigations Report; Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân; Nghị định 11/2014/NĐ-CP về hoạt động thông tin khoa học và công nghệ.


Bài viết liên quan ​

Cập nhật gần nhất:

Sản phẩm của Công ty Cổ phần Metis.