avatar
文章
32
标签
65
分类
4
主页
标签
分类
关于
友情链接
思想是一个锐化的过程
搜索
主页
标签
分类
关于
友情链接

思想是一个锐化的过程

vscode上一种优雅的debug方式
发表于2025-05-28|编程日记
vscode 如何debug python torchrun deepspeed[自用,防忘记]⚠️ 写在前面(一定要看) debug程序的方式有很多种。每一种方式都各有缺点:有的方式虽然优雅,但是局限性很大;有的方式麻烦,但是局限性小。 常规方式: 优点:然后可以观察所有线程。一劳永逸。 缺点:就是写参数很麻烦,但是你可以让chatgpt等大模型帮你写。 最最最优雅的方式: 优点:就是需要在代码里面,加入几行代码。方便快捷。 缺点:有时候断点不生效,只能在一个线程里面启动。 建议先使用【常规形式】、如果【常规形式】不够用,再使用【最最最优雅的方式】 B站手把手视频 常规方式:https://www.bilibili.com/video/BV1Hh4y1i7Li 对于torchrun这种形式:https://www.bilibili.com/video/BV1b84y1R75V 对于deepspeed这种形式: https://www.bilibili.com/video/BV1xC4y1P7LH 最最最优雅的方式:https://www.bilibili.co...
Bert用于命名实体识别任务(NER)
发表于2025-05-23|AI
前记:BERT(Bidirectional Encoder Representation from Transformers)是2018年10月Google AI研究院提出的一种预训练-微调大模型,和GPT属于是同一时期的产物。BERT在多项自然语言处理任务上都实现了SOTA,抛弃了传统模型,在一种任务上需要修改模型架构的方式,而是同一个模型架构在不需要修改的情况下,应用于多个任务上。因此,一经问世就引起了学术界极大地关注,甚至超过了GPT。 BERT的网络架构使用的是基于Transformer中的Encoder部分,由于其使用Attention的关系,从而避免了传统网络结构,诸如RNN,LSTM,GRU等的遗忘问题,可以捕获一个长序列不同token的相关性问题。 Bert架构图如下: 网络结构介绍:这里重点介绍一下Bert的嵌入编码部分,后面部分就是Encoder模块的堆叠了,并没有什么新奇的。Bert的嵌入编码有三部分,分别是token Embedding,position Embedding, segment Embedding,之所以这里需要segment Embeddi...
大模型中的三角位置编码实现
发表于2025-05-20|AI
三角位置编码公式: Transformer中嵌入表示 + 位置编码的实现12345678910111213141516171819202122232425262728293031323334353637import torchimport mathfrom torch import nn# 词嵌入位置编码实现class EmbeddingWithPosition(nn.Module): """ vocab_size:词表大小 emb_size: 词向量维度 seq_max_len: 句子最大长度 (人为设定,例如GPT2的最大长度是1024) """ def __init__(self, vocab_size, emb_size, dropout=0.1, seq_max_len=5000): self.seq_emb = nn.Embedding(vocab_size, emb_size) # 序列中每个token的embedding向量表示 # 位置...
大模型中的KVCache技术
发表于2025-05-20|AI
Transformer中的KVCache优化原理前记:现在KVCache已经属于是必备的技术了,但是博主发现自己只是听过这个名词,但是并不了解该技术的原理和实现,遂学习记录了本博客 1.首先KVCache技术有什么用?答:KVCache技术主要帮助模型在推理过程,避免重复的计算,从而减少计算量,加快模型推理速度,同时也会带来成本的降低,设想如果是用户使用一款由该模型作为基座的大模型产品,那么更快的推理速度在用户层面会带来更好的用户体验,同时对于产品运营成本也有所降低。 2.KVCache技术是如何避免掉重复计算的?由下图可知,token在输入模型计算的过程中,存在重复计算的部分,可以发现通过前n个token计算结果获得第n+1个token预测,然后通过这n+1个token再输入到网络中来计算第n+2个token,细细一想,聪明的你是不是发现了后面n+1个token计算的时候,前n个token是不是重复计算了,也就是说 n+1个token输入到模型中,实际上前面n个token的计算,和之前只有n个token输入到网络中的计算结果是一样的,这样就带来了重复计算问题,那我们如何避免掉重...
Attention is all you need.
发表于2025-05-17|AI
德语->英语项目: https://github.com/TCcjx/pytorch_transformer-remake 项目目录结构(文件说明): .data(文件夹):数据集Multi30K checkpoints(文件夹):训练权重文件保存处 config.py:全局配置文件,DEVICE以及输入token的最大长度 dataset.py:数据预处理文件,构建德语和英语词表,实现德语和英语的词元token和IDX的一一隐射,以及德语和英语句子预处理函数(输入德语和英语句子,返回分词后的词元列表信息,以及词元ID列表) multihead_attn.py: 构建多头注意力机制模块,这里的实现同时也考虑了解码器中第二个多头注意力机制模块的代码复用,在编码器和解码器的多头注意力机制模块中都可以复用这个多头注意力机制的模块 encoder_block.py:编码器模块的构建 encoder.py:编码器的实现,同时自动处理PAD掩码矩阵,再传入encoder_block中,实现多个encoder_block的堆叠使用 decoder_block.py:解码器模块的构建 de...
1…34
avatar
TCcjx
生活给我出难题,我说ok小问题
文章
32
标签
65
分类
4
Follow Me
公告
欢迎志同道合的朋友,一起交流
最新文章
Agent Memory综述2026-07-01
从反向传播角度理解 PPO 损失函数2026-05-04
从底层架构到工程实战:深度拆解生产级 AI Agent 的记忆机制2026-05-02
理解学习率调度(余弦退火 + warmup)的原理和作用2026-04-23
Agent 一线实战:落地经验与 Know-How 分享2026-04-19
分类
  • AI14
  • 编程日记10
  • 论文阅读笔记6
  • 随笔2
标签
TKGs 图结构信息 DQN算法 contrastive learning LLMs 时态知识图谱推理 Transformer pyenv Self-Attention 实习总结 glue code Bert Linux 补全推理 文件传输 时态知识图谱补全 图谱推理任务 Ubuntu RL Agent PPO 文献阅读 pip vibe coding 深度学习 编程日记 LLM private Qwen2 Memory transfomers 大模型 debug 温度参数τ 强化学习 Agent memory Poetry Pretrain NER 服务器
归档
  • 七月 2026 1
  • 五月 2026 2
  • 四月 2026 2
  • 三月 2026 1
  • 十二月 2025 1
  • 十一月 2025 2
  • 十月 2025 3
  • 九月 2025 1
  • 八月 2025 3
网站信息
文章数目 :
32
本站总字数 :
25k
本站访客数 :
本站总浏览量 :
最后更新时间 :
© 2025 - 2026 By TCcjx框架 Hexo 7.3.0|主题 Butterfly 5.5.4
搜索
数据加载中