BTC$63,040 1.80%ETH$1,866 1.70%BNB$585.96 0.40%XRP$1.06 1.60%SOL$72.92 1.40%ADA$0.17253 1.60%AVAX$6.37 0.80%DOT$0.76086 0.90%BTC$63,040 1.80%ETH$1,866 1.70%BNB$585.96 0.40%XRP$1.06 1.60%SOL$72.92 1.40%ADA$0.17253 1.60%AVAX$6.37 0.80%DOT$0.76086 0.90%

Thị trường · ✦ AI tổng hợp

Claude AI tự tạo ra 'J-space' — cấu trúc nhận thức mà Anthropic không hề lập trình

Anthropic phát hiện một cấu trúc nội bộ tự xuất hiện trong mô hình Claude, được đặt tên là 'J-space', hoạt động như một không gian làm việc chung giữa các phần của mô hình. Phát hiện ngày 6/7 này mở ra hướng mới cho nghiên cứu an toàn AI và khả năng diễn giải hành vi của các mô hình ngôn ngữ lớn.

📅 07/07/20263 phút đọcNguồn: BeInCrypto

Anthropic phát hiện cấu trúc 'J-space' bên trong Claude AI

Anthropic vừa công bố một phát hiện bất ngờ: bên trong các mô hình Claude tồn tại một cấu trúc nội bộ mà chưa ai thiết kế hay lập trình trực tiếp. Cấu trúc này được các nhà nghiên cứu đặt tên là J-space, và nó xuất hiện một cách tự nhiên trong quá trình huấn luyện mô hình.

J-space là gì?

Theo nghiên cứu công bố ngày 6/7/2026, J-space là một vùng thông tin nội bộ nơi Claude có vẻ tập hợp và chia sẻ các dữ liệu quan trọng giữa các phần khác nhau của mô hình. Cách hình dung đơn giản nhất là xem nó như một "bảng trắng" bên trong AI — khi Claude xử lý câu hỏi, giải một bài toán hay thực thi lệnh, các chi tiết then chốt sẽ xuất hiện ở không gian chung này để các thành phần khác nhau của mô hình có thể truy cập.

Anthropic phát hiện J-space thông qua một công cụ nghiên cứu gọi là J-lens, cho phép quan sát cách thông tin di chuyển bên trong Claude trong quá trình xử lý tác vụ.

Liên hệ với lý thuyết nhận thức của con người

Điều đáng chú ý là J-space phản ánh rất sát một khái niệm trong khoa học thần kinh gọi là "global workspace" (không gian làm việc toàn cục). Trong nhận thức của con người, lý thuyết này mô tả cách não bộ đưa thông tin quan trọng đến nhiều quá trình tâm lý cùng lúc — chẳng hạn khi nghe một câu hỏi, nhớ lại một dữ kiện và quyết định cách trả lời, các mảnh thông tin đó cần hội tụ về một nơi.

Các thử nghiệm cho thấy Claude có thể mô tả nội dung J-space của chính mình khi được hỏi, thậm chí điều chỉnh những nội dung đó theo hướng dẫn. Quan trọng hơn, khi các nhà nghiên cứu can thiệp trực tiếp vào J-space, câu trả lời và hiệu suất xử lý tác vụ của Claude cũng thay đổi theo.

Ý nghĩa đối với an toàn AI

Phát hiện này có trọng lượng thực sự trong lĩnh vực AI safety. Nếu các nhà nghiên cứu có thể giám sát hoạt động J-space, họ có thể tiếp cận gần hơn với những động cơ tiềm ẩn đằng sau hành vi của mô hình — bao gồm cả việc phát hiện các cuộc tấn công prompt injection được thiết kế để thao túng đầu ra của AI.

Tuy nhiên, phạm vi còn hạn chế. Phần lớn quá trình xử lý thông tin của Claude vẫn diễn ra hoàn toàn ngoài J-space, nên đây mới chỉ là một cửa sổ nhỏ vào lớp xử lý bên trong.

Anthropic đã phát hành mã nguồn mở J-lens cùng một bản demo Neuronpedia, mời cộng đồng nghiên cứu rộng rãi cùng kiểm chứng kết quả.

Không phải tuyên bố về ý thức AI

Anthropic nhấn mạnh rõ ràng rằng nghiên cứu này không khẳng định Claude có ý thức hay trải nghiệm chủ quan. Thuật ngữ "consciously accessible" (thông tin có thể tiếp cận một cách có ý thức) chỉ mượn từ vựng khoa học nhận thức, chứ không phải là tuyên bố về ý thức thực sự.

Phát hiện này nối tiếp một chuỗi nghiên cứu dài hơi của Anthropic, bao gồm báo cáo về nhận thức nội tâm tự xuất hiện công bố tháng 10/2025 và các sáng kiến phúc lợi mô hình ra mắt tháng 4/2025 — cho thấy công ty đang ngày càng chú trọng vào việc hiểu rõ những gì thực sự xảy ra bên trong các hệ thống AI mà họ phát triển.

#AI#Anthropic#Claude#an toàn AI#nghiên cứu công nghệ#mô hình ngôn ngữ lớn
⚠️ Miễn trừ trách nhiệm: Bài viết này được tổng hợp và biên tập từ nhiều nguồn nhằm mục đích thông tin. Không phải lời khuyên đầu tư. Luôn tự nghiên cứu (DYOR) trước khi đưa ra quyết định.

/ Bài viết liên quan