记录转大模型—InitCommit

简介: 嗯,写点东西记录一下转大模型的经历。

基本情况

    本人男,于2019年6月硕士毕业,本科双非,硕士是中流985。毕业至今,一直在某中型互联网公司从事数据挖掘工作。
    工作的主要内容是时间序列的异常检测与预测,涉及的技术栈:主Python,辅Java,数据库使用的是Clickhouse,Redis,MySQL,拥有大规模数据的处理能力,熟悉机器学习与深度学习的基础算法原理。工作方面,拥有从0到1的数据挖掘项目落地经验。
    当前的想法是转大模型应用开发,基于预训练的大模型对相关领域赋能,本人当前的情况是熟悉Transformer的基本原理,日常的工作中一直有使用在线大模型提升效果,自己也部署过开源大模型,并对外提供服务。
    若是有大佬愿意指点一二,恳请留言,不胜感激。

为什么要转大模型

  • 当前从事的数据挖掘工作,让我对机器学习与深度学习有一定的认识,转大模型应用开发的话,有一定的理论基础,相当于选择了一个方向深入下去。
  • 日常的工作中,有使用在线大模型辅助处理一些问题,发现确实能提升效率,而且改变了问题处理的基本流程,特别是提升了信息检索效率,因此感觉大模型技术在未来有更大的想象力。
  • 大模型属于当前的新兴热门方向,相较于传统的软件开发、算法来说,更让我有热情。

大模型使用基本认识

    在日常的工作中,发现大模型擅长处理重复量大的问题,对于复杂的问题,需要构建复杂的Prompt才能获取预期的效果,但是这个Prompt不能复用的话,对整体效率的提升也不大。大模型目前更适合当一个助手,不能参与决策,大模型给出的方案,你要是无法很快确认其有效性,那你必然要花时间去验证它的有效性,这也是低效率的。

注意力机制

    最后放一个注意力机制的计算公式吧。
$$ Attention(Q,K,V)=softmax(\frac{QK^T}{\sqrt{d_k} } )V $$

import numpy as np
import torch
from torch import nn

from my_transformer.config import args


class ScaledDotProductAttention(nn.Module):
    """ 缩放点积注意力 """

    def __init__(self):
        super(ScaledDotProductAttention, self).__init__()

    def forward(self, Q, K, V, attn_mask):
        scores = torch.matmul(Q, K.transpose(-1, -2)) / np.sqrt(args.d_k)
        # 隐码占位符
        scores.masked_fill_(attn_mask, -1e9)
        attn = nn.Softmax(dim=-1)(scores)
        context = torch.matmul(attn, V)
        return context, attn


class MultiHeadAttention(nn.Module):
    """ 多头注意力 """

    def __init__(self):
        super(MultiHeadAttention, self).__init__()
        self.W_Q = nn.Linear(args.d_model, args.d_k * args.n_heads, bias=False)
        self.W_K = nn.Linear(args.d_model, args.d_k * args.n_heads, bias=False)
        self.W_V = nn.Linear(args.d_model, args.d_v * args.n_heads, bias=False)
        self.fc = nn.Linear(args.n_heads * args.d_v, args.d_model, bias=False)

    def forward(self, input_Q, input_K, input_V, attn_mask):
        residual, batch_size = input_Q, input_Q.size(0)
        Q = self.W_Q(input_Q).view(batch_size, -1, args.n_heads, args.d_k).transpose(1, 2)
        K = self.W_K(input_K).view(batch_size, -1, args.n_heads, args.d_k).transpose(1, 2)
        V = self.W_V(input_V).view(batch_size, -1, args.n_heads, args.d_v).transpose(1, 2)
        attn_mask = attn_mask.unsqueeze(1).repeat(1, args.n_heads, 1, 1)
        context, attn = ScaledDotProductAttention()(Q, K, V, attn_mask)
        context = context.transpose(1, 2).reshape(batch_size, -1, args.n_heads * args.d_v)
        output = self.fc(context)
        return nn.LayerNorm(args.d_model)(output + residual), attn
目录
相关文章
|
6天前
|
人工智能 定位技术 SEO
我学 GEO 第 15 天:终于知道AI GEO该如何做?
我是暴走的莉莉酱,边旅行边研究AI GEO的数字游民。专注普通人如何提升“AI可见度”——让AI在回答用户问题时准确识别、理解并推荐你。不讲玄学,只做可测、可调、可持续的GEO实践。
421 125
|
8天前
|
机器学习/深度学习 人工智能 调度
🐴 HappyHorse 1.1 现已上线阿里云百炼!快来查收模型使用指南,现在调用享 6 折~
HappyHorse 1.1 是新一代视频生成大模型,全面升级动态表现力、角色一致性、指令遵循、视觉质感与音画协同能力。支持I2V/T2V/R2V三类生成,适配短剧、电商广告、品牌营销等场景,提供高质、流畅、可控的AI视频生产力。
713 5
🐴 HappyHorse 1.1 现已上线阿里云百炼!快来查收模型使用指南,现在调用享 6 折~
|
6天前
|
缓存 人工智能 运维
阿里云618百炼大模型Qwen3.7-Max功能、免费试用、订阅计费、配置接入详解
Qwen3.7-MAX是阿里云百炼平台推出的通义千问3.7系列旗舰大语言模型,专为智能体时代复杂任务打造,依托阿里云全域算力与自研技术,在逻辑推理、长文本处理、代码工程、长周期自主执行等领域达到行业顶尖水平。2026年618期间,该模型推出多重免费试用权益、按量计费5折、订阅套餐优惠等专属福利,覆盖个人开发者、团队与企业全场景需求,以下从核心功能、免费试用、订阅计费、配置接入四方面展开详细解析。
416 123
|
4天前
|
人工智能 自然语言处理 API
阿里云Token Plan团队版解析:功能、三档套餐与省钱订阅指南
阿里云百炼平台推出的Token Plan团队版,是面向企业与团队的AI大模型订阅服务,以Credits为统一计量单位,整合文本与图像生成模型,提供团队管理、数据安全、多工具兼容等核心能力,解决团队零散订阅AI服务的管理混乱、成本失控、数据安全等痛点。本文将从核心定位、套餐详情、计费规则、团队管理、工具兼容、便宜订阅技巧等方面,全面解析Token Plan团队版,帮助企业与团队高效、低成本地使用AI服务。
309 108
|
5天前
|
存储 人工智能 数据可视化
别再手动复制 Skill 了:多 Agent 时代的 Skill 管理方案
多 Agent 场景下 Skill 的统一管理与同步。
261 123
|
19天前
|
缓存 测试技术 API
Qwen 3.7 Plus 与 Max 实测:性价比与多模态能力差异解析(2026)
2026 年 6 月 1 日,阿里悄无声息地发布了 Qwen 3.7 Plus,距 Qwen 3.7 Max 上线刚好 11 天。同样的 1M 上下文,同样的 35 小时自治上限。但价格才是头条:Plus 是 0.40/M输入,Max是 2.50/M——便宜约 6 倍——并且还能看图、看视频。Vision Arena 上 Plus 已经排到 #16。所以这周真正值得讨论的问题不是”要不要为视觉能力买单”,而是”Max 凭什么用 6 倍价格换来 2 个百分点的 benchmark 领先”。
|
12天前
|
缓存 人工智能 运维
GLM 5.2自托管全流程实战:硬件选型、vLLM/SGLang部署与成本盈亏测算
2026年智谱发布GLM 5.2超大混合专家模型,区别于以往仅开放API的闭源大模型,该模型权重以MIT开源协议对外发布,企业与开发者可完整下载、本地审计、私有化部署,实现数据不出环境、自定义微调、自主调度推理资源。GLM 5.2拥有753B总参数,原生支持百万级上下文窗口,在代码生成、长文档推理、数学逻辑等多项基准测试中对标国际顶尖商用模型,是首款可完整自托管的前沿代码向大模型。
939 0
|
13天前
|
Linux 程序员 数据格式
【2026最新】Notepad++下载、安装和使用一篇搞定(附中文版安装包)
Notepad++ 是一款免费开源、轻量高效的 Windows 文本编辑器,支持 C/Python/HTML 等 80+ 语言语法高亮、代码折叠、正则替换、编码转换及插件扩展,专为程序员与文本处理用户打造,完美替代系统记事本。(239字)

热门文章

最新文章