Hydro-Minim / Archives
归档
按时间折叠所有文章,像翻阅一组轻薄的创作年表。Year
2025
5 个月份11 月
1 篇10 月
2 篇
AIGC 生成式 AI
AIGC是通过AI自主生成文本、图像、视频、音频等内容的技术集合,核心在于“生成”。文本生成由大语言模型(LLM)驱动,图像/视频主要基于扩散模型(如DiT),音频分为语音合成(TTS)和音乐生成。需区分AIGC(应用层)、LLM(文本引擎)与AGI(能力愿景)。生成式模型的核心是学习数据分布以创造新内容,而判别式模型仅做分类。四大生成模型家族中,自回归LLM主导文本,扩散模型主导图像/视频,GAN和VAE逐渐边缘化。工程实践强调API调用、异步任务设计(任务队列与回调)及成本限流。学习路径建议从基础认知、核心技术到工程实践逐步深入。AIGC并非取代人类,而是扩展创造力的工具。
模型原理
Transformer 与模型微调
Transformer基于Encoder-Decoder双模块架构,Encoder通过双向自注意力理解上下文,Decoder通过单向自注意力生成文本。自注意力机制以Q/K/V三向量交互为核心,结合多头注意力和位置编码实现全局语义建模。大模型(如GPT-4)是Transformer在数据和算力极致扩展的产物。主流架构包括Causal Decoder(LLaMA)、Prefix Decoder(ChatGLM)和Encoder-Decoder(T5),其中Decoder-only因训练高效、生成能力强成为主流。微调技术中,LoRA通过低秩矩阵仅训练1%~5%参数,适应多任务;RLHF分SFT、奖励模型、PPO三阶段对齐人类偏好,DPO可简化流程。实际应用中建议优先高质量指令数据,小数据量用Chat模型,大数据量用Base模型,RLHF可跳过奖励模型直接DPO。掌握这些核心知识能帮助高效落地大模型任务。
模型原理
09 月
3 篇
通过WSL2、Docker 和 NPS 实现网站部署方案
本教程指导将闲置笔记本变为个人服务器,通过WSL2(Ubuntu 24.04)在Windows下运行Linux环境,安装Docker及Docker Compose实现应用容器化部署,再使用NPS内网穿透工具(VPS服务器端+本地客户端)将本地服务暴露至公网。以Navidrome音乐服务器为例演示完整流程:配置WSL2资源、调整防火墙、安装Docker、编写docker-compose.yml并启动服务。关键结论:WSL2提供一致开发环境;Docker简化部署;NPS通过服务器端与客户端映射实现公网访问;需注意国内VPS可能需备案,防火墙仅开放必要端口。读者可低成本、无公网IP条件下自由部署个人网站。
网站部署
使用 Cloudflare Tunnel 实现内网穿透
该教程介绍了一个用于管理 Cloudflare Tunnel 的 Linux 脚本 `cf-tunnels.sh`,支持安装隧道、选择性删除隧道及完全删除 `cloudflared`。使用前提:拥有 Cloudflare 账号并添加域名,Linux 服务器具备 sudo 权限。通过下载脚本、赋予执行权限并运行,即可出现菜单选择操作。安装时需输入隧道名称、域名及本地服务端口(默认 80),脚本自动完成 `cloudflared` 安装、登录授权、隧道创建和系统服务配置,确保开机自启。选择性删除会列出所有隧道,用户指定要删除的隧道 ID 或名称,脚本清理连接并删除隧道,但需手动前往 Cloudflare 官网删除相关 DNS 记录。完全删除则停止并移除 `cloudflared` 及其所有文件。此脚本简化了隧道生命周期管理,但删除隧道后需手动清理 DNS 记录。
网站部署
Flink 详解(二):水位线 Watermark 与乱序、迟到数据处理
Flink 的水位线机制基于事件时间驱动窗口计算,解决分布式系统时间偏差导致的统计不准确。对于有序数据(事件时间单调递增),使用单调时间戳策略;无序数据则通过 `forBoundedOutOfOrderness` 设置最大乱序延迟,容忍部分迟到数据。用户可自定义周期型或定点型水位线生成策略,满足特定业务触发条件。迟到数据通过两层兜底:`allowedLateness` 允许窗口结束后二次计算,`sideOutputLateData` 将完全迟到的数据放入侧输出流单独处理。合理搭配乱序延迟、允许迟到时间和侧输出流,可平衡数据完整性与计算延迟,灵活应对实时场景中的时间相关挑战。
Flink
08 月
3 篇
Flink 详解(一):分区算子、Process Function 与窗口机制
本文系统梳理Flink三大核心机制:分区算子通过keyBy等策略实现数据重分配,keyBy按key哈希分区是有状态计算和窗口聚合的前提;Process Function作为最底层原语,支持直接访问时间戳、状态、定时器及侧输出流,可灵活分流迟到或异常数据;窗口机制将无界流切为时间/计数桶,提供滚动、滑动、会话窗口及增量聚合(ReduceFunction/AggregateFunction)与全窗口(ProcessWindowFunction)函数,结合Trigger和Evictor可定制触发时机与数据清理。掌握这些内容能应对数据倾斜、乱序处理、复杂聚合等场景,构建高效流处理应用。
Flink
ClickHouse 详解:列式存储 OLAP 数据库与 MergeTree 引擎家族
ClickHouse 是专为 OLAP 场景设计的列式存储数据库,通过列式存储减少 IO、提升压缩率,配合向量化执行和多核并行实现高性能。其 MergeTree 引擎家族是生产主力,通过分区、排序键和稀疏索引加速查询;ReplacingMergeTree 等变体支持去重、求和、折叠等特殊需求。数据类型涵盖整型、浮点、Decimal、字符串、时间等。索引包括一级稀疏索引和二级跳数索引,分区裁剪可跳过无关分区。副本(ReplicatedMergeTree + ZooKeeper)与分片(Distributed 引擎)实现高可用和横向扩展。注意局限:不支持事务、行级修改效率低,适合海量数据聚合分析而非高频 OLTP。
ClickHouse
HDFS 与 MapReduce 详解:存储架构、高可用与 YARN 运行流程
本文系统介绍Hadoop体系:HDFS 1.0中,NameNode管理元数据,DataNode存储数据块,写入采用pipeline方式,SecondaryNameNode辅助合并编辑日志。HDFS 2.0通过ZooKeeper、ZKFC和QJM解决单点故障,实现主备切换与元数据一致。YARN作为资源调度层,由ResourceManager、NodeManager和Container组成;MapReduce作业由ApplicationMaster申请资源,执行MapTask和ReduceTask。Shuffle机制核心为环形缓冲区溢写、分区归并与排序。文中还以作战比喻和Mapper/Reducer执行流程帮助理解。本文让读者掌握HDFS高可用原理、YARN调度流程以及MapReduce核心Shuffle机制。
Hadoop