從這裡開始
這裡的文章多半用一張圖 + 精簡的文字,把複雜的東西講清楚。我把它們借用 Clean Architecture 的分層來組織——越靠核心越穩定、越能遷移(觀念);越往外越具體、越會被替換(工具)。依賴指向核心、學習也一樣:先把內圈的觀念打牢,再往外學會被換掉的工具。
核心觀念:最穩、最能遷移的一層
這一層是換幾份工作都還在用的東西——查詢語言、資料工程的心智地圖、資料密集系統的原理。工具會被替換,這些不會。先把這裡打牢,再往外走。
📚 Fundamentals of Data Engineering 讀書筆記 · 11 篇
- 1 資料工程是什麼:讀《Fundamentals of Data Engineering》Ch.1
- 2 資料工程生命週期:讀《Fundamentals of Data Engineering》Ch.2
- 3 好的資料架構怎麼設計:讀《Fundamentals of Data Engineering》Ch.3
- 4 技術到底該怎麼選:讀《Fundamentals of Data Engineering》Ch.4
- 5 資料從哪來:源頭系統與資料生成,讀《Fundamentals of Data Engineering》Ch.5
- 6 資料要存在哪:儲存的階層與抽象,讀《Fundamentals of Data Engineering》Ch.6
- 7 把資料搬進來:批次還是串流?讀《Fundamentals of Data Engineering》Ch.7
- 8 把資料變好用:查詢、建模與轉換,讀《Fundamentals of Data Engineering》Ch.8
- 9 資料的最後一哩:服務給分析與 ML,讀《Fundamentals of Data Engineering》Ch.9
- 10 最該重視卻最被忽略的一章:安全與隱私,讀《Fundamentals of Data Engineering》Ch.10
- 11 資料工程的未來:工具會變、地基不變,讀《Fundamentals of Data Engineering》Ch.11(完結)
📚 SQL 我以為我懂 · 12 篇
📚 Designing Data-Intensive Applications 讀書筆記 · 12 篇
- 1 可靠、可擴展、可維護:資料系統的三個目標
- 2 資料模型:關聯式、文件、圖,你在選什麼
- 3 儲存引擎:LSM-tree、B-tree,與欄式儲存
- 4 編碼與演化:讓新舊程式碼,讀得懂彼此的資料
- 5 複製:單主、多主、無主,與延遲的三個怪象
- 6 分區:range 還是 hash、二級索引擺哪、以及怎麼重新平衡
- 7 交易:快照隔離擋不住的 write skew,與可串行化的三條路
- 8 分散式系統的麻煩:不可靠的網路、不可信的時鐘,與半死不活的節點
- 9 一致性與共識:linearizability、CAP 的誠實版,與全序廣播
- 10 批次處理:MapReduce 的精神、join 的兩條路,與不可變輸入的美德
- 11 串流:雙寫的陷阱、CDC,與流表二象性
- 12 資料系統的未來:拆開的資料庫、Kappa,與端到端的正確性(完結)
轉換與架構:把觀念組織成系統
介於觀念與工具之間的一層——怎麼把原始資料煉成可用模型、怎麼安排轉換與分層,以及幾個我認為最該懂的架構觀念。
基礎設施:落地觀念的具體工具
最外層、最具體、也最會被替換的一層。這些工具各自把上面的觀念變成能跑的東西——但它們是「手段」,核心觀念才是「目的」。看工具時,常回頭想它在實作哪個觀念。
📚 記憶體資料結構 · Redis 學習筆記 · 12 篇
- 1 Redis 是什麼:不只是快取,是記憶體資料結構伺服器
- 2 Redis 的靈魂:五大資料結構 + 進階武器
- 3 Redis 單執行緒為什麼反而快?——以及 O(N) 命令的地雷
- 4 Redis 持久化:RDB 快照 vs AOF 日誌,資料到底會不會丟
- 5 Redis 的過期與淘汰:TTL、惰性刪除與 maxmemory 政策
- 6 快取三大災難:穿透、擊穿、雪崩,與正確解法
- 7 分散式鎖:從 SETNX 到 Redlock,與那場著名的爭議
- 8 主從複製:讀寫分離與複製延遲的怪現象
- 9 高可用:Sentinel 怎麼自動故障轉移
- 10 Redis Cluster:16384 個 slot 怎麼分片與擴縮
- 11 管線、交易與 Lua:省 RTT 與原子性
- 12 Pub/Sub vs Stream:Redis 版的訊息系統
📚 事件串流 · Kafka 學習筆記 · 5 篇
📚 分散式運算 · Spark 學習筆記 · 6 篇
📚 工作流程編排 · Airflow 學習筆記 · 9 篇
- 1 Apache Airflow 是什麼?從 cron 到工作流程編排
- 2 跑起第一個 Airflow:Docker 環境 + 你的第一個 DAG
- 3 Airflow 排程的真相:data interval、catchup 與 backfill
- 4 Airflow 任務間怎麼傳資料:XCom、TaskFlow 進階與 params
- 5 Airflow 怎麼連外部系統:Provider、Operator、Hook、Sensor
- 6 Airflow 複雜流程控制:branching、trigger rules、TaskGroup、動態任務
- 7 Airflow 可靠性實戰:冪等、重試、SLA 與告警
- 8 Airflow 測試與部署:別讓一個 typo 弄垮整包 DAG
- 9 Airflow 進階:Datasets、deferrable operators 與 executor 選型
📚 容器編排 · Kubernetes 學習筆記 · 14 篇
- 1 Kubernetes 是什麼:從「跑容器」到「宣告你要的狀態」
- 2 Pod、Node、Scheduler:Kubernetes 叢集的三個原子
- 3 Deployment 與自我修復:reconcile loop 的實戰
- 4 Service:擋在短命 Pod 前面的固定門牌
- 5 ConfigMap 與 Secret:把設定和機密從映像檔裡拆出來
- 6 K8s 儲存:Volume、PV/PVC 與 StatefulSet
- 7 進階排程:讓 Pod 去對的 node
- 8 Airflow + Spark 跑在 K8s 上:不同的 node 怎麼跑不同的 pod
- 9 Ingress 與叢集 DNS:一個入口進來、一個名字相認
- 10 NetworkPolicy 與 CNI:Pod 之間的防火牆
- 11 RBAC:誰能對叢集做什麼
- 12 叢集管理:kubeadm、etcd 備份、升級
- 13 故障排除:Pod、Node、Control Plane 怎麼查
- 14 打包與部署:Helm 與 Kustomize
📚 基礎設施即程式碼 · Infrastructure as Code 讀書筆記 · 8 篇
📚 組態管理 · Ansible for DevOps 讀書筆記 · 4 篇
📚 分散式協調 · 單篇
📚 橫向視角:把工具當 infra 養(維運 / 部署 / 平台)· 從 Infra 角度看資料工具 · 9 篇
可靠度與可觀測性:貫穿每一層
這一層橫切全部——資料要正確、服務要不掛、變更要安全,而這一切的前提是「看得見」。SRE 講的是可靠度的觀念與文化(為什麼);Grafana LGTM 這套可觀測性工具講的是怎麼把它變成真的儀表板、告警與 SLO(怎麼做)。這也是我現在身兼 DE team EM 與 SRE、最花心力的一塊。
📚 可靠度的觀念與文化 · Google SRE 讀書筆記 · 19 篇
- 1 SRE 是什麼?從 Error Budget 講起
- 2 DevOps vs SRE:一個是介面,一個是實作
- 3 SLI / SLO / SLA:一個量測、一個目標、一個合約
- 4 消除 Toil:把重複的維運當成待消滅的 bug
- 5 監控:四個黃金訊號
- 6 告警與 On-call:什麼時候該把人吵醒
- 7 有效除錯:除錯是方法,不是天分
- 8 Blameless Postmortem:把故障變成組織的學習
- 9 事件應變:大事故真正的敵人是混亂
- 10 為可靠度測試:測試不是證明沒 bug,是讓你敢快
- 11 連鎖失效與過載:別讓一台倒下拖垮全部
- 12 資料管線與資料完整性:有備份不等於能還原
- 13 自動化、發布工程與簡單性:讓『改變』又快又安全
- 14 負載平衡:先選對機房,再選對機器
- 15 分散式共識:一群會掛的機器,如何對同一件事達成一致
- 16 SRE 空降一間『什麼都自建』的公司,前 90 天怎麼站穩
- 17 可靠的 cron:最單純的定時任務,一分散就變難
- 18 生產就緒審查(PRR):SRE 憑什麼接手一個服務
- 19 維運中斷:殺死生產力的不是工作量,是被切碎的時間
📚 可觀測性工具:LGTM 全家桶 · Grafana LGTM 可觀測性 · 8 篇
戰爭故事:拿真實系統,重打一次
上面每一層的觀念,在這裡用真實做過(也真實做錯過)的系統驗收。第一個戰場:直播代購電商平台——使用者留言下單、庫存不能超賣、金流物流一條鏈;每章先講當年怎麼做,再講如果重來會怎麼設計。
📚 Re:從零開始做直播代購電商平台 · 21 篇
- 1 全景:留言下單的一筆訂單,會經過哪些系統
- 2 起手式:五個元件與一條 CI/CD
- 3 留言即下單:把聊天室變成下單通道
- 4 身分與帳號:留言的那個人,到底是誰
- 5 庫存:不能超賣,是這個系統唯一的鐵律
- 6 購物車到訂單:被主播拔掉的狀態機
- 7 第三方金流:教科書的三個坑,與一個沒有坑的地形
- 8 出貨前處理:賣的是承諾,出的是現實
- 9 主播與營運後台:沒有一個叫「後台」的東西
- 10 權限:誰能按哪顆按鈕——我們改了三次
- 11 優惠與金額:折扣算錯,比超賣還難查
- 12 通知系統:兩個欄位、一支排程,和一通電話
- 13 風控與黑名單:不是逐客令,是信用體系
- 14 開賣瞬間:主播喊完 key 的那三秒
- 15 沒有 SRE 的年代:backend lead 的上線日記
- 16 對帳:我們沒有做,為什麼帳還是對的
- 17 上傳容易,刪除難:圖片與資源的生命週期
- 18 六個工程師,跑出二十個人的速度
- 19 三個人的微服務:暫停開發之後
- 20 平行世界:如果變成 SaaS
- 21 Re:如果真的重來
人與成長:技術領導
技術之外的另一條線——帶人的功課,和 2026 年開始同樣重要的:帶 AI 的功課。
📚 成為 Tech Leader 讀書筆記 · 8 篇
- 1 領導力
- 2 領導力 - MOI
- 3 領導力 - 成長模型
- 4 領導力 - 成為 Leader 的迷思與痛苦
- 5 領導力 - 創新的三大障礙
- 6 領導力 - 用日記看見自己
- 7 領導力 - 發想力
- 8 領導力 - 願景
📚 帶 AI 的手藝(2026) · 4 篇
想找特定主題?用右上角的搜尋,或到 標籤頁 依主題瀏覽。