记录转大模型—InitCommit

简介: 嗯,写点东西记录一下转大模型的经历。

基本情况

    本人男,于2019年6月硕士毕业,本科双非,硕士是中流985。毕业至今,一直在某中型互联网公司从事数据挖掘工作。
    工作的主要内容是时间序列的异常检测与预测,涉及的技术栈:主Python,辅Java,数据库使用的是Clickhouse,Redis,MySQL,拥有大规模数据的处理能力,熟悉机器学习与深度学习的基础算法原理。工作方面,拥有从0到1的数据挖掘项目落地经验。
    当前的想法是转大模型应用开发,基于预训练的大模型对相关领域赋能,本人当前的情况是熟悉Transformer的基本原理,日常的工作中一直有使用在线大模型提升效果,自己也部署过开源大模型,并对外提供服务。
    若是有大佬愿意指点一二,恳请留言,不胜感激。

为什么要转大模型

  • 当前从事的数据挖掘工作,让我对机器学习与深度学习有一定的认识,转大模型应用开发的话,有一定的理论基础,相当于选择了一个方向深入下去。
  • 日常的工作中,有使用在线大模型辅助处理一些问题,发现确实能提升效率,而且改变了问题处理的基本流程,特别是提升了信息检索效率,因此感觉大模型技术在未来有更大的想象力。
  • 大模型属于当前的新兴热门方向,相较于传统的软件开发、算法来说,更让我有热情。

大模型使用基本认识

    在日常的工作中,发现大模型擅长处理重复量大的问题,对于复杂的问题,需要构建复杂的Prompt才能获取预期的效果,但是这个Prompt不能复用的话,对整体效率的提升也不大。大模型目前更适合当一个助手,不能参与决策,大模型给出的方案,你要是无法很快确认其有效性,那你必然要花时间去验证它的有效性,这也是低效率的。

注意力机制

    最后放一个注意力机制的计算公式吧。
$$ Attention(Q,K,V)=softmax(\frac{QK^T}{\sqrt{d_k} } )V $$

import numpy as np
import torch
from torch import nn

from my_transformer.config import args


class ScaledDotProductAttention(nn.Module):
    """ 缩放点积注意力 """

    def __init__(self):
        super(ScaledDotProductAttention, self).__init__()

    def forward(self, Q, K, V, attn_mask):
        scores = torch.matmul(Q, K.transpose(-1, -2)) / np.sqrt(args.d_k)
        # 隐码占位符
        scores.masked_fill_(attn_mask, -1e9)
        attn = nn.Softmax(dim=-1)(scores)
        context = torch.matmul(attn, V)
        return context, attn


class MultiHeadAttention(nn.Module):
    """ 多头注意力 """

    def __init__(self):
        super(MultiHeadAttention, self).__init__()
        self.W_Q = nn.Linear(args.d_model, args.d_k * args.n_heads, bias=False)
        self.W_K = nn.Linear(args.d_model, args.d_k * args.n_heads, bias=False)
        self.W_V = nn.Linear(args.d_model, args.d_v * args.n_heads, bias=False)
        self.fc = nn.Linear(args.n_heads * args.d_v, args.d_model, bias=False)

    def forward(self, input_Q, input_K, input_V, attn_mask):
        residual, batch_size = input_Q, input_Q.size(0)
        Q = self.W_Q(input_Q).view(batch_size, -1, args.n_heads, args.d_k).transpose(1, 2)
        K = self.W_K(input_K).view(batch_size, -1, args.n_heads, args.d_k).transpose(1, 2)
        V = self.W_V(input_V).view(batch_size, -1, args.n_heads, args.d_v).transpose(1, 2)
        attn_mask = attn_mask.unsqueeze(1).repeat(1, args.n_heads, 1, 1)
        context, attn = ScaledDotProductAttention()(Q, K, V, attn_mask)
        context = context.transpose(1, 2).reshape(batch_size, -1, args.n_heads * args.d_v)
        output = self.fc(context)
        return nn.LayerNorm(args.d_model)(output + residual), attn
目录
相关文章
|
人工智能 数据可视化 数据挖掘
AI竟能独立完成顶会论文!The AI Scientist-v2:开源端到端AI自主科研系统,自动探索科学假设生成论文
The AI Scientist-v2 是由 Sakana AI 等机构开发的端到端自主科研系统,通过树搜索算法与视觉语言模型反馈实现科学假设生成、实验执行及论文撰写全流程自动化,其生成论文已通过国际顶会同行评审。
1647 34
AI竟能独立完成顶会论文!The AI Scientist-v2:开源端到端AI自主科研系统,自动探索科学假设生成论文
|
人工智能 缓存 自然语言处理
全球首款开源通用型AI智能体上线!Suna:自动处理Excel/爬数据/写报告等复杂任务一句话搞定
Suna是由Kortix推出的开源通用型AI智能体项目,通过自然语言交互实现浏览器自动化、文件管理、数据分析等复杂任务处理,支持自托管部署,为研究分析和日常工作提供智能辅助。
3045 55
全球首款开源通用型AI智能体上线!Suna:自动处理Excel/爬数据/写报告等复杂任务一句话搞定
|
机器学习/深度学习 自然语言处理 安全
ACL 2025 | GALLa:用图结构增强代码大模型,让代码理解更精准!
通过级联多模态架构将代码结构图对齐到大模型表征中
957 69
|
机器学习/深度学习 人工智能 JSON
这个AI把arXiv变成代码工厂,快速复现顶会算法!Paper2Code:AI论文自动转代码神器,多智能体框架颠覆科研复现
Paper2Code是由韩国科学技术院与DeepAuto.ai联合开发的多智能体框架,通过规划、分析和代码生成三阶段流程,将机器学习论文自动转化为可执行代码仓库,显著提升科研复现效率。
2051 19
这个AI把arXiv变成代码工厂,快速复现顶会算法!Paper2Code:AI论文自动转代码神器,多智能体框架颠覆科研复现
|
人工智能 自然语言处理 数据可视化
让AI单次生成4万字!WriteHERE:开源AI长文写作框架,单次生成超长文本,小说报告一键搞定!
WriteHERE是基于异质递归规划技术的开源AI写作框架,能动态分解写作任务并管理任务依赖关系,支持单次生成超过4万字的专业报告。
2774 55
让AI单次生成4万字!WriteHERE:开源AI长文写作框架,单次生成超长文本,小说报告一键搞定!
|
人工智能 开发框架 决策智能
谷歌开源多智能体开发框架 Agent Development Kit:百行代码构建复杂AI代理,覆盖整个开发周期!
谷歌开源的Agent Development Kit(ADK)是首个代码优先的Python工具包,通过多智能体架构和灵活编排系统,支持开发者在百行代码内构建复杂AI代理,提供预置工具库与动态工作流定义能力。
2976 3
谷歌开源多智能体开发框架 Agent Development Kit:百行代码构建复杂AI代理,覆盖整个开发周期!
|
人工智能 IDE API
白板秒变IDE,草图直接生成可运行代码!Pad.ws:白板+代码编辑器深度结合,创意到实现无缝衔接
Pad.ws是一款创新的在线开发环境,将交互式白板与完整IDE工具深度结合,支持多人实时协作和多种编程语言,无需安装即可通过浏览器访问。
1100 1
白板秒变IDE,草图直接生成可运行代码!Pad.ws:白板+代码编辑器深度结合,创意到实现无缝衔接
|
人工智能 搜索推荐
「社会实验室」成真!SocioVerse:复旦联合小红书开源社会模拟世界模型,用AI预演群体行为
SocioVerse是由复旦大学联合小红书等机构开源的社会模拟框架,基于大语言模型和千万级真实用户数据构建,能精准模拟群体行为并预测社会事件演化趋势。
1324 2
「社会实验室」成真!SocioVerse:复旦联合小红书开源社会模拟世界模型,用AI预演群体行为
|
人工智能 自然语言处理 监控
基于DeepSeek R1改进的AI安全模型!MAI-DS-R1:微软开源AI安全卫士,敏感话题响应率高达99.3%
微软开源的MAI-DS-R1是基于DeepSeek R1改进的AI模型,通过后训练优化将敏感话题响应率提升至99.3%,同时将有害内容风险降低50%,保持原版推理能力并增强多语言支持。
1614 3
基于DeepSeek R1改进的AI安全模型!MAI-DS-R1:微软开源AI安全卫士,敏感话题响应率高达99.3%
|
机器学习/深度学习 人工智能 文件存储
Llama Nemotron:英伟达开源基于Llama架构优化的推理模型,253B参数持平DeepSeek R1!
NVIDIA推出的Llama Nemotron系列推理模型,基于Llama架构优化,包含Nano/Super/Ultra三款,在数学推理、编程和工具调用等任务中展现卓越性能。
607 5
Llama Nemotron:英伟达开源基于Llama架构优化的推理模型,253B参数持平DeepSeek R1!

热门文章

最新文章