VỀ MINHLAB

Một nơi để học sâu hơn bằng cách ghi lại những gì mình đang xây dựng.

MinhLab là blog cá nhân nơi tôi ghi lại những thứ mình đang học, những project đang xây dựng và những câu hỏi vẫn đang tìm lời giải trong AI và Computer Science.

Vòng lặp học tập & xây dựng MinhLabSơ đồ chu trình 4 bước: Learn (Học), Build (Xây dựng), Write (Ghi chép), Share (Chia sẻ) kết nối các node kỹ thuật và tín hiệu truyền dữ liệu.STEP 01LEARNHọc sâuSTEP 02BUILDThử nghiệmSTEP 03WRITEGhi chépMinhLabLOOP ↺<paper_read />def experiment():note.publish()
Learn, Build, Write, Share - Vòng lặp phát triển MinhLab

TRIẾT LÝ HỌC TẬP

Tại sao tôi bắt đầu MinhLab?

Trong quá trình học và làm việc với AI, tôi nhận ra rằng mình hiểu một kiến thức rõ nhất khi tự hệ thống lại, thử nghiệm và giải thích nó bằng ngôn ngữ của chính mình.

MinhLab được tạo ra như một blog chia sẻ kiến thức AI, đồng thời là một engineering notebook công khai để lưu lại những gì tôi học được trong quá trình xây dựng, thử nghiệm và giải quyết các vấn đề kỹ thuật thực tế.

Nội dung tại MinhLab tập trung vào cả nền tảng lý thuyết lẫn cách áp dụng vào thực tế. Từ việc một mô hình hay thuật toán hoạt động như thế nào, đến cách thiết kế pipeline, xử lý lỗi, đánh giá các lựa chọn kỹ thuật và những bài học rút ra trong quá trình triển khai.

Thay vì chỉ ghi lại kết quả cuối cùng hoặc tổng hợp thông tin có sẵn, MinhLab hướng đến việc chia sẻ quá trình tư duy, thử nghiệm và kinh nghiệm thực tế đằng sau mỗi vấn đề. Tôi muốn những ghi chép này vừa giúp bản thân hệ thống lại kiến thức, vừa có thể hữu ích cho những người đang học và làm việc trong lĩnh vực AI.

PAPER NOTE 0142026.08
Understanding Attention & Scaling

Q: Why does self-attention scale O(n²)?

Attention(Q, K, V) = softmax(Q Kᵀ / √dₖ) V

Takeaway: Pairwise dot product matrix scales quadratically with sequence length n.

EXPERIMENT● RUNNING
CLIP Multimodal Retrieval Pipeline
Frame Extraction: 2 FPS
Embeddings: ViT-B/32
Recall@10: 84.2%
ENGINEERING ARCHMinhLab Stack
Edge Runtime + Vector Storage

Next.js App Router deployed on Cloudflare Workers edge, leveraging D1 SQLite for metadata & R2 for media assets.

KNOWLEDGE MAP

Những thứ tôi thường tìm hiểu

Nội dung của MinhLab thay đổi theo những gì tôi đang học và xây dựng, nhưng phần lớn xoay quanh một vài chủ đề sau.

01FUNDAMENTALS

Machine Learning

Nền tảng toán học, mô hình cốt lõi & các bài toán tối ưu hóa cơ bản.

RegressionClassificationOptimization
02ARCHITECTURES

Deep Learning

Kiến trúc mạng neural, phương pháp huấn luyện & intuitions trực quan.

CNNsResNetBackprop
03LLMs & AGENTS

Large Language Models

Transformers, kỹ thuật retrieval (RAG) & các kiến trúc AI agent.

TransformersRAGVector DBAgents
04MULTIMODAL

Computer Vision

Biểu diễn hình ảnh, vision-language models & xử lý dữ liệu video.

CLIPObject DetectionVideo Search
05SYSTEMS

AI Engineering

Từ ý tưởng nghiên cứu & prototype đến hệ thống thực tế chạy ổn định.

DeploymentPipelinesOptimization

LEARNING PROCESS

Học bằng cách làm

Đọc giúp tôi bắt đầu hiểu một vấn đề. Nhưng phần lớn những gì thực sự nhớ được đến từ lúc thử implement, gặp lỗi, thay đổi giả thuyết và buộc phải giải thích lại nó theo cách đơn giản hơn.

01Read

Đọc

Nghiên cứu paper, tài liệu & codebase gốc

02Understand

Hiểu

Bóc tách bản chất thuật toán & intuitions

03Build

Thử

Bắt tay tự implement prototype từ đầu

04Break

Sai

Va chạm với bug, bottleneck & giới hạn thực tế

05Fix

Sửa

Thử nghiệm giả thuyết mới & tối ưu hoá

06Write

Ghi lại

Tổng kết bài học lên MinhLab để dùng lại

CURRENT FOCUS

Hiện tại tôi đang khám phá

Các định hướng nghiên cứu và thử nghiệm kỹ thuật mà tôi đang tập trung nhiều nhất thời gian này.

01Search · Ranking · Multimodal

Video Retrieval

Tìm kiếm và hiểu nội dung trong những tập video lớn sử dụng vision-language embeddings & OCR.

02Transformers · RAG · Agents

Large Language Models

Tìm hiểu sâu hơn cách Transformer, tokenization, retrieval và agent tương tác với dữ liệu.

03CLIP · Embeddings · Cross-modal

Multimodal AI

Cách text, image và video có thể được biểu diễn chung trong cùng một không gian vector semantic.

04Systems · Evaluation · Edge

AI Engineering

Biến model và research idea thành những ứng dụng thực sự chạy được trên hạ tầng thực tế.

BUILDING IN PUBLIC

Một số thứ đang được xây dựng

AIC Video Retrieval System

Một hệ thống tìm kiếm và truy vấn nội dung video tự động sử dụng vision-language embeddings (CLIP), transcript, OCR và retrieval pipeline để xử lý lượng video dung lượng lớn.

Khám phá các bài viết liên quan →
System Pipeline
Keyframe / Audio ExtractionTransNetV2
Embeddings GenerationCLIP ViT-B/32
Vector Search IndexingQdrant / FAISS
Natural Language QueryText-to-Video

LỜI KẾT

Nếu một ghi chú ở đây giúp bạn hiểu một thứ nhanh hơn, MinhLab đã làm đúng việc của nó.

Tôi vẫn đang học, nên nội dung ở đây cũng sẽ thay đổi cùng với những gì tôi đang tìm hiểu và xây dựng.