Trong cộng đồng AI mã nguồn mở, ai cũng nhận thấy khoảng cách giữa họ và các “ông lớn” công nghệ không chỉ đơn thuần là sức mạnh tính toán. Ai2 đang nỗ lực thu hẹp khoảng cách này, bằng cách cung cấp cơ sở dữ liệu và mô hình mã nguồn mở và gần đây nhất là Tülu 3 – một quy trình hậu huấn luyện mở, dễ điều chỉnh, giúp chuyển đổi các mô hình ngôn ngữ lớn (LLM) từ dạng “thô” sang dạng ứng dụng thực tiễn.
Khác với quan niệm phổ biến, các mô hình ngôn ngữ “nền tảng” sau khi được huấn luyện xong chưa sẵn sàng để triển khai. Tiền huấn luyện là bước cần thiết, nhưng chưa đủ. Thậm chí, nhiều chuyên gia tin rằng tiền huấn luyện có thể sớm không còn là yếu tố quan trọng nhất.
Giá trị thực sự được tạo ra ở giai đoạn hậu huấn luyện. Đây là giai đoạn “nhào nặn” mô hình từ một mạng lưới khổng lồ, chứa đựng lượng kiến thức đồ sộ, nhưng chưa được tinh chỉnh, có thể tạo ra cả nội dung tiêu cực lẫn tích cực.
Các công ty lớn thường giữ bí mật về quy trình hậu huấn luyện của họ. Lý do là, mặc dù ai cũng có thể thu thập dữ liệu web và xây dựng mô hình bằng các phương pháp tiên tiến, nhưng việc tinh chỉnh mô hình để phục vụ cho các mục đích cụ thể, ví dụ như hỗ trợ trị liệu tâm lý hay phân tích nghiên cứu, lại là một thách thức hoàn toàn khác biệt.
Ai2 (trước đây là Viện AI Allen) đã lên tiếng về sự thiếu minh bạch trong các dự án AI “mở” như Llama của Meta. Mặc dù mô hình này miễn phí sử dụng và điều chỉnh, nhưng nguồn dữ liệu, quy trình tạo ra mô hình thô và phương pháp huấn luyện để sử dụng chung vẫn được giữ kín. Điều này không hẳn là xấu, nhưng cũng không thực sự “mở”.
Ngược lại, Ai2 cam kết tối đa hóa tính minh bạch, từ việc công khai dữ liệu, quy trình thu thập, quản lý, làm sạch dữ liệu, đến phương pháp huấn luyện được sử dụng để tạo ra các LLM như OLMo.
Tuy nhiên, thực tế là rất ít nhà phát triển có đủ năng lực để tự vận hành LLM, và càng ít người có thể thực hiện hậu huấn luyện như Meta, OpenAI hay Anthropic. Nguyên nhân một phần là do thiếu kiến thức chuyên môn, một phần do quy trình này phức tạp và tốn thời gian.
Với mong muốn dân chủ hóa khía cạnh này của hệ sinh thái AI, Ai2 đã phát triển Tülu 3. Đây là phiên bản cải tiến vượt bậc so với quy trình hậu huấn luyện trước đó (Tülu 2). Kết quả thử nghiệm cho thấy Tülu 3 đạt hiệu suất tương đương với các mô hình “mở” tiên tiến nhất hiện nay. Để đạt được điều này, Ai2 đã dành nhiều tháng nghiên cứu, thử nghiệm, phân tích các thông tin được hé lộ từ các công ty lớn, và thực hiện nhiều lần huấn luyện lặp đi lặp lại.
Tülu 3 bao gồm toàn bộ quy trình, từ việc lựa chọn trọng tâm cho mô hình (ví dụ: giảm khả năng đa ngôn ngữ, tăng cường toán học và lập trình), đến việc áp dụng các kỹ thuật quản lý dữ liệu, học tăng cường, tinh chỉnh, điều chỉnh siêu tham số và quy trình huấn luyện. Mục tiêu là tạo ra một mô hình hiệu quả, tập trung vào các kỹ năng cần thiết.
Ý nghĩa quan trọng của Tülu 3 là giúp cộng đồng AI mã nguồn mở giảm sự phụ thuộc vào các công ty tư nhân. Trước đây, việc xây dựng LLM tùy chỉnh thường phải sử dụng tài nguyên của các công ty lớn hoặc thuê dịch vụ từ bên thứ ba, dẫn đến chi phí cao và rủi ro bảo mật.
Ví dụ, với các công ty nghiên cứu và dịch vụ y tế, việc sử dụng API của OpenAI hoặc hợp tác với Scale để tùy chỉnh mô hình nội bộ đều tiềm ẩn rủi ro liên quan đến dữ liệu người dùng nhạy cảm. Tülu 3, cùng với các mô hình mã nguồn mở như OLMo, mang đến giải pháp thay thế hiệu quả, cho phép triển khai và kiểm soát toàn bộ quy trình huấn luyện ngay tại chỗ.
Bản thân Ai2 cũng đang sử dụng Tülu 3, đây là minh chứng rõ ràng nhất cho hiệu quả của công cụ này. Mặc dù các kết quả thử nghiệm hiện tại sử dụng Llama làm mô hình nền tảng, Ai2 dự kiến sẽ sớm ra mắt mô hình dựa trên OLMo và được huấn luyện bởi Tülu 3, hứa hẹn mang đến những cải tiến vượt trội hơn nữa, đồng thời hoàn toàn là mã nguồn mở.
Tin tài trợ
-
Tài trợKhám phá
Samsung “vượt mặt” Meta trong cuộc đua kính AR?
Samsung được cho là đang phát triển một cặp kính thực tế tăng cường (AR) để cạnh tranh với các sản phẩm kính mắt của Meta. Theo Yonhap News, Samsung có thể sẽ ra mắt thiết bị này tại sự kiện Galaxy Unpacked vào tháng 1 năm sau. Kính AR của Samsung: Những thông tin […] -
Tài trợMobile
Huawei Nova 13 sắp ra mắt toàn cầu
Sau khi ra mắt thành công tại thị trường Trung Quốc vào tháng 10, Huawei đã sẵn sàng đưa bộ đôi nova 13 và nova 13 Pro đến tay người dùng quốc tế. Theo thông tin từ Huawei, hai mẫu smartphone này sẽ được giới thiệu tại sự kiện ở Dubai vào ngày 12/12, cùng […] -
Tài trợAI
Google sẽ thay đổi ngành quảng cáo trực tuyến với AI tạo video?
Không còn là những tay “cò mồi” mồm mép trong bộ vest lịch lãm, những “Mad Men” thời hiện đại chính là các công ty công nghệ như Google, đang lấp đầy không gian quảng cáo bằng những nội dung AI rẻ tiền và vô hồn. Mới đây, Google đã ra mắt Veo, một công […] -
Tài trợKhám phá
Xreal One Series: Kính AR “phá vỡ” giới hạn kết nối
Tại CES Las Vegas đầu năm nay, kính AR Xreal Air 2 Ultra đã gây ấn tượng mạnh mẽ, nhưng thành công của nó phụ thuộc vào sự đa dạng của ứng dụng. Xreal dường như đã tìm ra giải pháp cho vấn đề này với dòng kính AR One Series mới: tăng cường khả […]
Bài viết liên quan
Samsung “vượt mặt” Meta trong cuộc đua kính AR?
Google sẽ thay đổi ngành quảng cáo trực tuyến với AI tạo video?
Android tích hợp AI vào tính năng chia sẻ file, trợ năng như thế nào?
Meta “lột xác” Llama, bất ngờ với những cải tiến vượt bậc
AI của OpenAI gia nhập lĩnh vực quốc phòng
Spotify Wrapped 2024 gây thất vọng cho người dùng: Vì sao?
Trải nghiệm thế giới ảo 3D từ ảnh thường với công nghệ mới
Apple “vấp ngã” khi đưa AI của Baidu vào iPhone tại Trung Quốc
Robot bị hack: Lỗ hổng trong AI có thể gây hại
DeepMind “khuấy đảo” lĩnh vực dự báo thời tiết với AI GenCast
Google “nhá hàng” tính năng AI mới cho tìm kiếm
Sử dụng Threads? Hãy cẩn thận với dữ liệu cá nhân của bạn!
iGenius và Nvidia: “Cặp đôi hoàn hảo” tạo nên bước đột phá trong lĩnh vực AI?
Google Photos ra mắt tính năng “Nhìn lại năm 2024” đầy cảm xúc
AI siêu thông minh: Lo ngại về sự phát triển vượt tầm kiểm soát
Grok “tuyên chiến” với ChatGPT, miễn phí cho người dùng X
LGM-Aero: Công nghệ AI giúp thiết kế máy bay chỉ trong vài ngày
ChatGPT Pro giá 200 USD/tháng, bạn có sẵn sàng chi trả?
PaliGemma 2: AI cải tiến khả năng nhận diện hình ảnh
ĐĂNG KÝ NHẬN TIN
NGAY HÔM NAY
Đăng ký để nhận thông tin sớm nhất về những câu chuyện nóng hổi hiện nay trên thị trường, công nghệ được cung cấp hàng ngày.
Bằng cách nhấp vào “Đăng ký”, bạn chấp nhận Điều khoản dịch vụ và Chính sách quyền riêng tư của chúng tôi. Bạn có thể chọn không tham gia bất cứ lúc nào.
5
s
Nhận xét (0)