news 2026/8/31 22:24:16

【大模型】happy-llm笔记

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【大模型】happy-llm笔记

happy-llm是datawhale发布的一套关于llm的教程,链接在此,今天看了这套课程的第二章到第四章的内容,对自己一直以来好奇的一些llm相关的问题有了解答。
将我遇到的问题整理到下面,部分可能没有回答,感兴趣的同学可以去原课程查找。

  1. 为什么注意力机制里有一个softmax,能否用其他函数代替?
    因为注意力想表征的是某个token(Q)对每个token的相关性,也即应该用一个概率分布或加权求和来表示,因此使用类似于x i ∑ i x i \frac{x_i}{\sum_i x_i}ixixi的形式表示,至于用softmax,是因为其在概率分布的基础上用自然指数来凸显强相关。
  2. 什么是自注意力?如何理解“自”
  3. 什么是多头注意力,为什么向量内积的拼接和向量拼接的内积效果相同?
  4. 为什么mask是一个矩阵,attention相对于RNN提升并行性的措施有哪些?
    RNN的线性性体现在不知道未来的信息,而这可以通过一个mask得到解决
  5. 为什么GPT和LLM使用的很多都是Decoder-only结构,这有什么原因?
  6. LLAMA是什么,和GPT有什么区别?
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 21:07:44

为什么99%的量子计算项目忽略镜像缓存?这3个致命后果你承担得起吗?

第一章:量子计算镜像的构建缓存 在量子计算模拟环境中,构建高效的系统镜像是加速实验迭代的关键环节。通过引入构建缓存机制,可以显著减少重复编译量子电路和初始化环境的时间开销。该机制依赖于对量子模拟器依赖项、中间量子态快照以及经典控…

作者头像 李华
网站建设 2026/8/31 21:23:08

横河WT3000E WT1800 WT500功率分析仪

WT3000E 横河WT3000E功率分析仪 目前光伏逆变器等设备的整体工作效率已达到90%至96%。要进一步提高效率,即使是几个小数点,对制造商来说也是件***挑战且至关重要的事情。WT3000E作为功率分析仪,所提供的水平可以真正验证效率上的细微改进。 精…

作者头像 李华
网站建设 2026/8/31 6:02:45

吉时利DMM7510 DMM6500数字万用表

DMM7510型仪表实现数据可视化和灵活交互性的结合。DMM7510具有信号分析灵活性;5英寸电容触摸显示屏使得它易于观察、交互和测量,具有双指缩放功能。这个高性能和易用性组合可以使用户提高工作效率,深入洞察测量。 DMM7510型7位半触摸屏数采万…

作者头像 李华
网站建设 2026/8/31 14:54:09

Tesseract识别总出错?用Dify打造专属词典,让误识别成为历史

第一章:Tesseract识别总出错?问题根源深度剖析Tesseract OCR 在实际应用中常出现识别准确率低的问题,其根本原因往往并非引擎本身缺陷,而是输入数据质量与配置策略不当所致。深入分析这些因素,有助于精准定位并优化识别…

作者头像 李华
网站建设 2026/8/31 14:44:06

每秒钟提取视频25帧

import cv2 import os from pathlib import Pathdef extract_frames(video_path, output_dirNone, frames_per_second25):"""从视频中提取帧图像Parameters:video_path (str): 视频文件路径output_dir (str): 输出目录,默认为视频同名文件夹frames_p…

作者头像 李华
网站建设 2026/8/31 11:00:09

降低“输入摩擦”,是我今年提升效率最大的收获

在技术工作中,我们经常关注:算法是否高效架构是否合理工具是否顺手但我最近意识到一个被忽略的点: 输入摩擦,其实是效率杀手。无论是写技术文档、需求说明,还是复盘总结, 大量时间并不是花在“思考”&#…

作者头像 李华