Chính phủ Mỹ cùng các tập đoàn công nghệ Meta Platforms và Alphabet, công ty mẹ của Google, đang tham gia tổ chức phi lợi nhuận Biohub để xây dựng các bộ dữ liệu mở phục vụ huấn luyện mô hình AI cho nghiên cứu sinh học, nâng tổng vốn đầu tư vào dự án lên 1,8 tỉ USD, Biohub cho biết ngày 7-10.
Meta, Google DeepMind và công ty khởi nghiệp phát triển thuốc Isomorphic Labs sẽ cùng đầu tư 300 triệu USD. Bộ Năng lượng Mỹ sẽ rót hơn 500 triệu USD trong 5 năm cho các hoạt động đo lường trong phòng thí nghiệm, xây dựng mô hình và tính toán. Trong khi đó, Viện Y tế Quốc gia Mỹ (NIH) sẽ điều phối các bộ dữ liệu và kho dữ liệu được xây dựng từ hơn 500 triệu USD ngân sách liên bang đã cấp trước đây, sau đó Biohub sẽ chuẩn hóa các dữ liệu này để huấn luyện AI.
Các cam kết mới được đưa ra sau khoản 500 triệu USD mà Biohub – tổ chức hoạt động vì mục tiêu từ thiện do CEO Meta Mark Zuckerberg và vợ ông, bác sĩ Priscilla Chan, thành lập – dành cho dự án hồi tháng 4.
Các khoản đầu tư sẽ tài trợ cho Sáng kiến Sinh học Ảo (Virtual Biology Initiative), nhằm đo lường phản ứng của tế bào trước nhiều thay đổi và trong nhiều điều kiện hơn đáng kể so với những gì giới khoa học từng nghiên cứu. Dữ liệu thu được sẽ được sử dụng để xây dựng các mô hình dự đoán, qua đó có thể rút ngắn quy trình phát triển thuốc vốn thường kéo dài nhiều năm.
“Cho đến nay, sinh học phần nào vẫn là một ngành khoa học dựa trên những khám phá đầy khéo léo,” Chan nói trong một cuộc phỏng vấn. “Chúng tôi luôn xem đây là tài sản chung của cộng đồng, chứ không chỉ thuộc về một nhóm, để nó có thể tiếp tục được xây dựng và phát triển theo thời gian.”
Theo Alex Rives, người đứng đầu bộ phận khoa học của Biohub, các bộ dữ liệu cuối cùng sẽ được công khai, nhưng những công ty tài trợ sẽ được tiếp cận trước.
“Với các nhà tài trợ thương mại, chúng tôi có những giai đoạn tạm thời chưa công bố dữ liệu, trong đó các nhóm có thời gian nghiên cứu dữ liệu, sau đó dữ liệu sẽ trở thành nguồn tài nguyên khoa học công khai,” Rives nói.
Cơ chế này giúp Biohub thu hút nguồn vốn tư nhân vào một dự án mà tổ chức mô tả là khoa học mở. Rives cho biết các dự án được chính phủ tài trợ và triển khai song song sẽ không bị áp dụng những hạn chế tương tự. Biohub cũng dự kiến tiếp cận các công ty dược phẩm và các tổ chức từ thiện để huy động thêm vốn.
Theo Rives, các bộ dữ liệu tế bào hiện nay có quy mô lên tới hàng trăm triệu tế bào, trong khi để xây dựng một mô hình dự đoán chính xác cần dữ liệu từ hàng tỉ và cuối cùng là hàng nghìn tỉ tế bào. Biohub đặt mục tiêu thu hẹp khoảng cách này.
“Chúng ta cần ghi lại ngôn ngữ của sinh học, cần ghi lại ngôn ngữ của tế bào. Hiện nay chưa có điều đó,” ông nói.
Dữ liệu sẽ được thu thập bằng nhiều kỹ thuật, trong đó có giải trình tự phiên mã không gian (spatial transcriptomics), phương pháp lập bản đồ hoạt động phân tử bên trong mô còn nguyên vẹn, cùng các phương pháp sàng lọc ghi nhận cách tế bào phản ứng trước những thay đổi của môi trường. Phần lớn loại dữ liệu này chưa từng được tạo ra theo một phương thức phối hợp, có hệ thống.
Rives cho biết công việc này thông thường có thể mất hàng chục năm, nhưng các đối tác muốn rút ngắn xuống còn 5 năm, với bộ dữ liệu đầu tiên dự kiến hoàn thành trong khoảng một năm. Ông kỳ vọng các mô hình dự đoán có độ chính xác cao sẽ được xây dựng trong vòng 5 năm.
Các phòng nghiên cứu AI khác cũng đang theo đuổi những sáng kiến tương tự. Anthropic đã đẩy mạnh nghiên cứu sinh học với việc xây dựng một phòng thí nghiệm thực nghiệm, trong khi OpenAI Foundation khởi động chương trình tài trợ hơn 125 triệu USD cho các bộ dữ liệu sinh học và y khoa phục vụ nghiên cứu AI.

Hai vợ chồng Mark Zuckerberg và Priscilla Chan tham dự lễ trao giải Breakthrough Prize 2025 tại Santa Monica, California, Mỹ, ngày 5-4-2025. Ảnh: Reuters

