Home KHO TRI THỨCDữ liệu thô vs dữ liệu tinh lọc: câu hỏi quan trọng nhất
Minh họa ba tầng dữ liệu: raw data hỗn loạn bên trái, curated data gọn gàng giữa, compiled data tổng hợp bên phải

Dữ liệu thô vs dữ liệu tinh lọc: câu hỏi quan trọng nhất

by Bửu Trung
0 comments

Sai lầm lớn nhất của người dùng Obsidian + AI

Khi ai đó bắt đầu dùng Obsidian kết hợp với AI (Claude, ChatGPT, Copilot), họ thường bị cuốn vào một vòng lặp nguy hiểm: copy → paste → import → auto-convert.

Bạn tìm được bài viết hay, yêu cầu Claude tóm tắt, paste vào Obsidian. Rồi 10 bài nữa. Rồi 100 bài. Bạn dùng automation để bulk import từ RSS, email newsletters, Twitter threads. Thậm chí chạy script để convert hàng ngàn file từ Notion, Evernote vào Obsidian.

Sau vài tháng, bạn có vault với 5.000 notes. Graph view đẹp kinh khủng. Bạn chụp ảnh share lên mạng xã hội. Mọi người khen: “knowledge system quá solid!”

Nhưng khi mở random một note từ 3 tháng trước, bạn không nhớ tại sao đã lưu nó. Không nhớ ý chính. Không biết nó liên quan gì đến dự án hiện tại. Vault trở thành thùng rác xịn hơn: trông đẹp, nhưng không có giá trị thực.

Đây chính là vấn đề dữ liệu thô mà không có dữ liệu tinh lọc.

Ba loại dữ liệu: raw, curated, compiled

Dữ liệu thô (raw data) là những thứ bạn copy trực tiếp từ nguồn gốc. Đoạn text từ bài viết, screenshot từ Twitter, trang PDF, nội dung email. Raw data là dữ liệu chưa qua xử lý, chưa qua bộ lọc cá nhân của bạn. Copy nó vào vault không có nghĩa bạn đã hiểu nó.

Dữ liệu tinh lọc (curated data) là những thứ bạn đã đọc kỹ, lựa chọn chủ động, và liên hệ với kinh nghiệm cá nhân. Bạn không chỉ lưu raw data; bạn lưu lại vì sao nó quan trọng, nó kết nối với cái gì, bạn sẽ dùng nó khi nào. Curated data có context của bạn.

Dữ liệu tổng hợp (compiled data) là những thứ bạn (hoặc AI) đã tổng hợp từ nhiều nguồn thành cái gì đó mới. Đọc 10 bài về machine learning, tổng hợp thành 1 bài “Beginner’s Guide to ML”. Compiled data là mức cao nhất vì nó yêu cầu hiểu đủ để kết nối ý tưởng từ nhiều chỗ khác nhau.

Sự khác biệt đơn giản: raw = “tôi copy bài này vào Obsidian.” Curated = “tôi copy bài này, viết ghi chú, và link đến project X.” Compiled = “tôi tổng hợp 5 bài thành 1 bài về topic Y.”

Hầu hết mọi người đang tạo vault đầy raw data và gọi nó là curated data. Đó là nguyên nhân chính tại sao knowledge system không hoạt động.

Karpathy pattern: raw folder vs wiki folder

Andrej Karpathy đã đề xuất cách tiếp cận giải quyết vấn đề này rất rõ ràng. Ông gọi nó là LLM Wiki pattern.

Raw folder chứa tất cả dữ liệu thô: bài viết clip, PDF scan, notes gốc. Đây là immutable, bạn không chỉnh sửa. Nó là source of truth.

Wiki folder chứa files mà bạn (hoặc AI) đã tổng hợp từ raw folder. Summary notes, concept notes, bài viết kết nối các raw sources. Wiki folder là nơi giá trị được tạo ra.

Karpathy pattern quan trọng vì nó buộc bạn phải có bước lọc. Bạn không thể lười paste raw data vào wiki folder. Phải có quy trình: raw → đọc/phân tích → wiki. Cách này cũng tạo clear boundary: tìm trong wiki sẽ cho kết quả có giá trị, không phải đống raw data. Chi tiết về pattern này ở bài Karpathy pattern.

Progressive summarization: bốn tầng lọc

Nếu Karpathy pattern là về cấu trúc thư mục, Progressive Summarization của Tiago Forte là về quy trình lọc từng cấp độ.

Tầng 1 (capture): Copy/paste nội dung. Đây là raw data, không có gì đặc biệt.

Tầng 2 (bold): Vài ngày sau, review lại note, bold những phần hữu ích. Không bold toàn bộ, chỉ bold ý quan trọng. Tầng này bắt buộc đọc kỹ note, nhưng không cần quá sâu. Đây là first filter.

Tầng 3 (highlight): Có thể vài tuần sau, khi cần dùng note cho project, highlight những phần bold có giá trị nhất. Chỉ “best of the best”. Đây là second filter, chặt hơn tầng 2.

Tầng 4 (executive summary): Viết tóm tắt bằng từ của bạn ở đầu note. Không copy paste, phải viết lại. Đây là third filter, quan trọng nhất, vì buộc bạn phải hiểu thực sự note là gì.

Cái thông minh của Progressive Summarization: bạn không phải làm hết 4 tầng cho tất cả notes. Chỉ làm đến tầng nào mà note thực sự cần. Note không bao giờ dùng lại? Để ở tầng 1 mãi mãi. Note rất quan trọng và dùng liên tục? Sẽ tự nhiên đẩy qua 4 tầng.

Collector’s fallacy: collect không phải learn

Collector’s fallacy là sai lầm tin rằng collect information = biết information. Bạn bookmark bài viết hay, tưởng đã “biết” nội dung. Nhưng thực tế chưa làm gì cả ngoài save link.

Tại sao lại xảy ra? Vì có psychological reward khi save thứ gì đó. Bạn cảm thấy đang tiến bộ, cảm thấy “have it”. Nhưng bạn không. Bạn chỉ có access đến nó mà thôi.

Điều này trở nên tệ hơn khi dùng AI. AI summarize bài viết 30 giây. Bạn paste summary vào Obsidian. Tưởng đã hiểu bài viết. Nhưng không. Bạn chỉ đọc summary của AI. Hành động collect không bằng understand. Nếu bạn không đi qua các tầng lọc, bạn đang rơi vào collector’s fallacy. Đặc biệt nguy hiểm trong thời đại AI, vì AI có thể auto-summarize, tạo ra ảo tưởng rằng bạn đã hiểu.

Cách tránh: đừng collect quá nhiều cùng lúc. Collect một bài, đọc nó, viết ghi chú, liên kết nó, xong rồi collect bài tiếp. Bài thu thập không tích trữ giải thích chi tiết hơn.

Bài test đơn giản: bạn có hiểu vault của mình?

Mở Obsidian, chọn random 10 notes, trả lời: “tại sao tôi lưu note này?”

Nếu trả lời được 8-10 notes, bạn đang đúng hướng. Hầu hết notes là curated, lưu vì lý do cụ thể.

Nếu chỉ trả lời được 2-3, hoặc “tôi không nhớ”, bạn đang quá nhiều raw data. Vault chứa quá nhiều thứ không cần thiết. Bạn cần cleanup: xác định notes hữu ích, xóa hoặc archive những notes không hữu ích. Một note mà bạn không dùng có giá trị là 0. Nó chỉ tạo thêm noise.

Framework FILTER-FOCUS-FLOW

FILTER: Trước khi copy vào Obsidian, hỏi: “Tôi có thực sự cần cái này không? Nó liên quan đến mục tiêu hiện tại không?” Nếu “không chắc”, đừng save. Filter là upstream, lọc trước khi copy.

FOCUS: Khi đã save, định rõ: dùng khi nào? Cho project nào? Là reference hay learning material? Để inspire hay có facts? Focus là về context, liên kết note với purpose.

FLOW: Khi dùng notes, tạo flow từ raw → curated → compiled. Không dừng ở raw. Đọc, ghi chú, liên kết, tóm tắt. Dữ liệu di chuyển từ raw sang curated, cuối cùng sang compiled.

Framework này không phức tạp nhưng rất hiệu quả. Làm được ba cái này, vault sẽ không phải “thùng rác”, mà thật sự có giá trị.

Prompt template: dùng Claude distill raw data

Nếu bạn dùng AI để distill raw data thành curated data, đây là prompt template.

Tôi có một bài viết/note gốc (raw data) như sau:

[PASTE CONTENT HERE]

Dựa trên nội dung này, hãy:
1. Tóm tắt ý chính trong 2-3 câu
2. Liệt kê 3-5 insights quan trọng nhất
3. Gợi ý 2-3 câu hỏi tôi nên suy nghĩ
4. Gợi ý 2-3 cách áp dụng vào công việc của tôi

Viết súc tích, bằng tiếng Việt.

Prompt này buộc Claude đọc kỹ raw data, không chỉ summary đơn giản. Bạn được 4 outputs: summary, insights, questions, applications. Từ đó viết note với context và purpose, chứ không chỉ copy-paste. Nhưng nhớ: executive summary (tầng 4 của Progressive Summarization) phải là của bạn. Nếu để AI làm executive summary, bạn rơi vào collector’s fallacy.

Câu hỏi thường gặp

Có cần xóa tất cả raw data không?

Không. Cách Karpathy là giữ raw data ở folder riêng (raw/), chỉ làm việc ở wiki folder. Raw data là source of truth, bạn refer lại bất cứ lúc nào. Nhưng không tìm kiếm ở raw folder, tìm ở wiki.

Progressive Summarization phải làm cho tất cả notes?

Không. Chỉ làm đến tầng mà note thực sự cần. Research link xem một lần? Để tầng 1 mãi. Core concept dùng liên tục? Tự nhiên đẩy qua 4 tầng.

Dùng AI làm Progressive Summarization được không?

Có, nhưng cẩn thận. AI help bold và highlight được, nhưng executive summary (tầng 4) phải là của bạn. Tầng 4 là sense-making. Nếu để AI làm, bạn đọc summary của AI, không phải hiểu note gốc.

Vault quá nhiều raw data, bắt đầu từ đâu?

Bắt đầu từ hôm nay: không thêm raw data nữa. Curate những cái đã có. Dần dần vault sẽ chất lượng hơn. Nếu chỉ có 1 giờ/ngày, đừng dùng để copy-paste. Dùng để review 5-10 notes cũ, làm progressive summarization, hoặc xóa notes không cần. Vault nhỏ nhưng chất giúp bạn gấp 10 lần vault to nhưng rác.

Bài liên quan

Nguồn tham khảo

[1] Zettelkasten.de. The Collector’s Fallacy.

[2] Tiago Forte. Progressive Summarization: A Practical Technique for Designing Discoverable Notes.

[3] Andrej Karpathy. LLM Wiki Pattern — GitHub Gist.

Bửu Trung — Dân Lười, thích Tối ưu.

Vault của bạn đang ở tầng nào? Raw, curated, hay compiled? Thử test random 10 notes rồi chia sẻ kết quả, mình muốn biết.

You may also like

Leave a Comment