23/09/2025
[Bản tin - 2] Các nhà nghiên cứu tùy chỉnh công cụ AI tại ‘hackathon’ toàn cầu
Hơn 1200 nhà khoa học và lập trình viên khám phá cách mô hình ngôn ngữ lớn có thể được ứng dụng trong khoa học vật liệu và hóa học
---
BERLIN – Năm 2023, khi gia đình của Ben Blaiszik đi nghỉ, anh đã làm điều mà bất kỳ nhà khoa học dữ liệu nào cũng có thể làm khi có một cuối tuần rảnh: tổ chức một hackathon toàn cầu. Blaiszik, vốn được đào tạo trong lĩnh vực khoa học vật liệu nhưng hiện làm việc về học máy tại Đại học Chicago, cảm nhận rằng trí tuệ nhân tạo (AI) đang trên đà thay đổi lĩnh vực cũ của mình. “Tôi có thể thấy điều đó hiển hiện trước mắt,” anh nói. “Nhưng chúng ta chưa thực sự khám phá mảnh đất này.” Thế là anh quyết định thúc đẩy tiến trình bằng một cuộc thi thân thiện.
Tuần trước, lần tổ chức thứ ba của hackathon do Blaiszik khởi xướng đã thu hút hơn 1200 nhà nghiên cứu và lập trình viên từ khắp nơi trên thế giới. Trong suốt 48 giờ cùng vô số phần pizza, các nhóm tham gia trực tuyến và tại các điểm tổ chức trực tiếp đã cùng nhau khai thác sức mạnh của các công cụ được gọi là mô hình ngôn ngữ lớn (LLM) trong khoa học vật liệu và khám phá thuốc. Cạnh tranh cho những giải thưởng tiền mặt nhỏ, hơn 100 đội đã nộp video dài 2 phút để trình bày dự án—một số trông chẳng khác gì trailer Pixar giả lập chuyên nghiệp. Tất cả các bài dự thi đang được tập hợp thành một bài báo để minh họa sự đa dạng của các ứng dụng AI tiềm năng, từ việc tạo giả thuyết đến quản lý dữ liệu và dự đoán tính chất vật liệu. Các bài dự thi cũng làm nổi bật một thách thức then chốt: xây dựng các quy trình chuyên biệt để thu thập và chuẩn hóa dữ liệu nhằm biến một LLM thành công cụ nghiên cứu tùy chỉnh.
“Sự kiện này thực sự là một chất xúc tác cho những ý tưởng tuyệt vời,” Pepe Márquez, nhà khoa học vật liệu tại Đại học Humboldt, người tổ chức điểm thi đấu ở Berlin, cho biết. “Đây là cơ hội để mọi người tạm dừng công việc thường ngày và có sự tự do để thử nghiệm với các công cụ mới.”
LLM như ChatGPT của OpenAI hoạt động bằng cách hấp thụ khối lượng khổng lồ dữ liệu trực tuyến và sử dụng các mẫu được nhận diện để tạo ra chuỗi văn bản có tính hợp lý nhằm phản hồi đầu vào. Các mô hình này đã mở ra cánh cửa mới trong nghiên cứu khoa học, cho phép các nhà nghiên cứu rà soát tài liệu và “giải phóng dữ liệu bị mắc kẹt trong các bài báo” ở quy mô chưa từng có, Blaiszik nói. Nhưng ở trạng thái nguyên bản, LLM không phải lúc nào cũng là cộng sự phòng thí nghiệm đáng tin cậy. Chúng cần được điều chỉnh và tinh chỉnh để làm việc với những loại dữ liệu khoa học cụ thể—điều này đòi hỏi sự hợp tác liên ngành giữa các chuyên gia.
Chưa từng có kinh nghiệm với LLM, nghiên cứu sinh tiến sĩ vật lý Daniel Speckhard tại Humboldt đã lập nhóm cùng một nhà khoa học dữ liệu, một nhà khoa học máy tính, và một nhà toán học. Họ đặt mục tiêu kiểm tra khả năng của LLM trong việc dự đoán cách cấu trúc tinh thể của một vật liệu “thư giãn” về cấu hình năng lượng thấp nhất—một bước quan trọng để dự đoán tính chất của nó. Họ tinh chỉnh một LLM sẵn có, mô hình T5 của Google AI, bằng cách đưa vào dữ liệu tinh thể học chứa các ví dụ về cấu trúc tinh thể ở các mức năng lượng khác nhau. Sau đó, họ yêu cầu mô hình dự đoán cách một tinh thể mới sẽ thư giãn—chỉ dựa trên các mẫu trong dữ liệu đã thấy, không dùng bất kỳ lý thuyết vật lý nền tảng nào. Dù nhóm chỉ có thời gian huấn luyện mô hình trên một tập dữ liệu nhỏ, kết quả ban đầu khá khả quan, Speckhard cho biết.
Ấn tượng hơn khả năng đoán hành vi tinh thể phức tạp của mô hình, theo Speckhard, là việc nó dễ dàng được tùy chỉnh đến mức nào. Bằng cách nhờ các LLM khác hỗ trợ viết mã nhập và phân tích dữ liệu, nhóm đã hoàn thành trong 2 ngày những việc mà Speckhard sẽ phải mất hơn một tháng. Giờ đây anh xem LLM như một cộng sự đầy hứa hẹn trong nghiên cứu. Trước sự kiện, “tôi nghĩ chúng lấy đi hết niềm vui của khoa học—tôi muốn tự mình tiếp cận vấn đề,” anh nói. “Nhưng sau trải nghiệm này, tôi tin tưởng 100%.”
Một số đội hackathon khác thiết kế các tác tử tùy chỉnh—bao gồm một công cụ hỗ trợ giải quyết vấn đề kiểm soát chất lượng lâu đời trong sản xuất thuốc và vật liệu: biết nguyên liệu được sản xuất ở đâu và khi nào. Bằng cách trích xuất thông tin từ các tài liệu rải rác, tác tử AI có thể tạo một thẻ kỹ thuật số duy nhất để theo dõi chuỗi cung ứng thuốc trong trường hợp cần thu hồi vì an toàn. Những đội khác cho thấy cách các LLM nguồn mở hiện có có thể giúp thiết kế thuốc mới sau khi được đưa vào dữ liệu như cấu trúc 3D của các phân tử, rồi được huấn luyện để dự đoán hóa chất nào cần tổng hợp. Một đội khác xây dựng một chatbot “đồng phi công” kết hợp các công cụ AI sẵn có cho hóa học để giúp các nhà khoa học tạo giả thuyết nghiên cứu mới.
Márquez tin rằng AI có thể tăng tốc mạnh mẽ quá trình khám phá vật liệu, vốn hiện nay là một quy trình cồng kềnh dựa vào “trực giác hóa học, những gì bạn đọc được trong bài báo, hoặc những gì bạn có sẵn trong phòng thí nghiệm.” Nhưng dữ liệu huấn luyện cần thiết để tinh chỉnh công cụ thường khó tìm hoặc không sử dụng được. Một giải pháp là nền tảng NOMAD, do Márquez và đồng nghiệp phát triển trong thập kỷ qua, hiện là kho dữ liệu khoa học vật liệu tập trung lớn nhất, với hơn 19 triệu mục nhập cộng đồng cho hơn 4 triệu vật liệu. Tại hackathon ở Berlin, một số đội đã thiết kế chatbot để hướng dẫn các nhà khoa học sử dụng NOMAD, trong khi những đội khác xây dựng các quy trình trích xuất dữ liệu để tự động đưa kết quả phòng thí nghiệm vào cơ sở dữ liệu NOMAD.
Ana Velázquez, làm việc tại Helmholtz-Zentrum Berlin—một viện nghiên cứu công nghệ năng lượng—với vai trò “người quản lý dữ liệu” (data steward), đang hỗ trợ các nhà khoa học khai thác NOMAD. “Công việc của tôi là giúp việc số hóa trở nên dễ dàng hơn cho các nhà khoa học,” cô nói. Cô phối hợp với các nhà hóa học và vật lý để đánh giá cách AI có thể tăng tốc quy trình và phát triển các thiết lập NOMAD tùy chỉnh để tự động hóa phân tích dữ liệu. “Khi mọi thứ đã sẵn sàng, họ chỉ cần kéo-thả một tệp, và mọi thứ sẽ như phép màu với họ.”
Hiện nay, 32 giám khảo chuyên môn từ các viện nghiên cứu và tập đoàn đang xem xét các bài dự thi. Blaiszik dự định kết nối các đội thắng giải với các cố vấn và quỹ đầu tư mạo hiểm để giúp phát triển nguyên mẫu thành sản phẩm hoàn chỉnh. Nhưng ngay cả với những người sẽ không tiếp tục dự án, hackathon vẫn khuyến khích một điều ngày càng quý giá trong thời đại AI: làm việc nhóm. “Nguy cơ của AI là nó cho phép chúng ta làm quá nhiều mà không cần hợp tác với ai,” Kutlualp Tazefidan, một lập trình viên tại Viện Nghiên cứu và Thử nghiệm Vật liệu Liên bang Đức, người đã tham gia phát triển ứng dụng kiểm soát chất lượng, nói. “Chúng ta thực sự cần nhiều sự kiện như thế này hơn.”
Ngay sau đó, một đồng đội của anh, do tụt đường huyết sau khi ăn quá nhiều bánh ngọt, nói rằng não cô mờ mịt đến mức khó hoàn thành bản báo cáo. “Không sao đâu,” Tazefidan nói. “Tôi sẽ chỉ nhờ ChatGPT.”
------
Nguồn: Researchers customize AI tools at global ‘hackathon’ (19/09/2025)