MỘT BỘ TÀI LIỆU COMPUTER VISION ĐÁNG ĐỂ LƯU LẠI

vibecode

Administrator
Anh em đang học Computer Vision có thể tham khảo cuốn Introduction to Computer Vision của Stan Birchfield – NVIDIA.
Tài liệu này là không nhảy thẳng vào YOLO hay các model AI mới, mà đi khá đầy đủ từ nền tảng đến hiện đại:
🔹
Xử lý ảnh: convolution, filtering, morphology, edge detection...
🔹
Feature Detection, Optical Flow, Stereo Vision.
🔹
Camera Calibration, Epipolar Geometry, Structure from Motion.
🔹
CNN, Object Detection, Semantic/Instance Segmentation.
🔹
Vision Transformer, Self-Supervised Learning.
🔹
DINOv2, SAM, Vision-Language Models.
🔹
Open-Vocabulary Detection, Depth Estimation.
🔹
Diffusion Models và Neural Rendering.
Điểm hay hơn nữa là kiến thức không chỉ dừng ở công thức. Tác giả xây dựng theo hướng code-first, có các ví dụ Python với NumPy, OpenCV và PyTorch, giúp vừa đọc lý thuyết vừa kiểm chứng thuật toán bằng code.
Đây là nguồn khá phù hợp cho sinh viên và kỹ sư muốn hiểu Computer Vision theo đúng “gốc”:
từ pixel → geometry → deep learning → foundation models, thay vì chỉ biết gọi một model có sẵn rồi inference.
Anh em học Computer Vision, Robotics, Machine Vision có thể bookmark lại và học dần. Một bộ tài liệu khá dài, nhưng đi được hết thì nền tảng sẽ rất chắc.


1790955450640.png

📖
Sách: https://arxiv.org/pdf/2609.39627
💻
Lecture notes + code: https://sbirchfield.github.io/cvintro/
 
Back
Top