工作的这五年 work_5 = \int_{2020-01-13}^{2025-01-12} experience \ dtime 工作这五年,学数学的变成了搞技术的,抱着学好数理化,走遍天下都不怕的心态,忐忑地步入了社会。从广州到杭州再回到北京,机缘巧合下进入大数据应用的领域,先后服务于游戏、金融、广告行业,业 2025-01-12 人生 #总结
我的职业生涯 作为一个一直学纯数学的同学,在被迫转硕后不得不思考今后的人生:换个学校继续读博,但不想再浪费时间;直接去当个高中老师,但尚未实现自身的价值;因为一直对计算机比较感兴趣,最终决定换个方向从头开始,希望在接受社会的毒打后能够证明自己的价值。本篇文章将记录职业生涯一路走来的点点滴滴,持续更新中~ 2023-11-01 人生 #职业#总结
我所了解的Flink 工作后做了一段时间的SQL BOY,但从20年底开始不满足于现状,正好业务也有越来越多的实时需求,所以开始学习实时计算。从Java写起到回归SQL再到结合Python的探索,算是对Flink有了一定程度上的了解,本文将回顾个人学习经历,供自省与借鉴~ 2023-10-21 数据 #Flink#总结
我的数学生涯 曾经问过自己为什么选择数学,当时给出的答案是因为除了数学其他什么也不会。记忆里对数学一直很感兴趣,一路学到了中国的最高殿堂,只可惜最后迷路了,没有坚持下去。但一路走来,有过欣喜,有过悲伤,值得记录一下沿途的风景~ 2023-10-21 人生 #数学#总结
我理解的流批一体:从三条链路到一个参数 这篇文章由和cluade反复对话生成。全文用同一张订单宽表贯穿,从现状的三条链路讲到 Fluss + Paimon 的改造,最后落到 Materialized Table 的增量语义。 2026-08-23 数据 #Flink#Paimon#数仓
Fluss:重塑实时开发 大数据领域不时地出现一些名词,比如流批一体、湖仓一体、HSAP等,其实本质上就是在抹平界限,但笔者经历的实际落地场景并不多,核心原因就是在不牺牲原有功能的同时解决核心痛点。但最近结合Fluss的湖流一体出现,感觉它支持的特性可以重塑实时开发,整体感觉还不错,故本文就对Fluss的能力进行初步体验。 2026-05-17
Flink SQL回撤机制与问题 之前一直只是粗略地知道Flink SQL的回撤机制是为了保证数据的正确性而引入的,但没有想到它还引入一些不易察觉的副作用,对实时盯盘等要求高的场景需要花费额外的工作处理问题,如changelog乱序、中间错误结果暴露等。本文就讨论了具体的问题以及解法。 2026-05-10 数据 #Flink SQL
大数据性能调优 在分布式计算中,理论上没有数据倾斜问题,都可以靠加资源解决性能问题。与此同时,每个引擎都有其设计原理,需要针对其特性进行相应调优,本篇文章我们就从使用视角去看下如何优化性能。 数据倾斜 假设我们有两个表:订单表orders 和用户表users CREATE TABLE orders ( or 2025-10-07
SQL Is All Your Need:SQL2API 对于数据开发人员来说,由于看数是企业中的一个普适需求,从CEO到普通员工都需要通过数据来做决策,故各种BI系统如Superset等技术栈成熟,在准备好数据后就能利用SQL配置好各种图表,发布相应报表。但如果需要建设定制化的数据产品,就必须提供对应的API服务能力,这就走出了数据开发的舒适区了,不仅要 2025-04-16
你本可以发现谱序列——Timothy Y.Chow 本文旨在通过“自发现”的视角,揭示谱序列(spectral sequence)的本质与动机,消除其因复杂符号和索引带来的学习障碍,并展示其如何从过滤复形的自然分解中逐步涌现。 2025-03-30 数学 #翻译