Deephub_社区达人页

个人头像照片
Deephub
已加入开发者社区1041

勋章 更多

个人头像照片
专家博主
专家博主
个人头像照片
星级博主
星级博主
个人头像照片
技术博主
技术博主
个人头像照片
一代宗师
一代宗师

成就

已发布1485篇文章
353条评论
已回答0个问题
0条评论
已发布0个视频
github地址

我关注的人 更多

技术能力

兴趣领域
擅长领域
技术认证

暂时未有相关云产品技术能力~

公众号 Deephub-IMBA

暂无精选文章
暂无更多信息

2024年07月

2024年06月

  • 06.30 11:48:39
    发表了文章 2024-06-30 11:48:39

    深入解析高斯过程:数学理论、重要概念和直观可视化全解

    这篇文章探讨了高斯过程作为解决小数据问题的工具,介绍了多元高斯分布的基础和其边缘及条件分布的性质。文章通过线性回归与维度诅咒的问题引出高斯过程,展示如何使用高斯过程克服参数爆炸的问题。作者通过数学公式和可视化解释了高斯过程的理论,并使用Python的GPy库展示了在一维和多维数据上的高斯过程回归应用。高斯过程在数据稀疏时提供了一种有效的方法,但计算成本限制了其在大数据集上的应用。
  • 06.29 10:44:04
    发表了文章 2024-06-29 10:44:04

    Transformer 能代替图神经网络吗?

    Transformer模型的革新性在于其自注意力机制,广泛应用于多种任务,包括非原始设计领域。近期研究专注于Transformer的推理能力,特别是在图神经网络(GNN)上下文中。
  • 06.28 11:43:05
    发表了文章 2024-06-28 11:43:05

    RAG流程优化(微调)的4个基本策略

    在本文中,我们将介绍使用私有数据优化检索增强生成(RAG)的四种策略,可以提升生成任务的质量和准确性。通过使用一些优化策略,可以有效提升检索增强生成系统的性能和输出质量,使其在实际应用中能够更好地满足需求。
  • 06.27 10:22:13
    发表了文章 2024-06-27 10:22:13

    Theta方法:一种时间序列分解与预测的简化方法

    Theta方法整合了两个基本概念:分解时间序列和利用基本预测技术来估计未来的价值。
  • 06.26 11:42:22
    发表了文章 2024-06-26 11:42:22

    精选:15款顶尖Python知识图谱(关系网络)绘制工具,数据分析的强力助手

    这里有15款免费工具推荐:NetworkX(Python基础),Graph-tool(C++速度),Graphviz(可视化库),ipycytoscape(Jupyter集成),ipydagred3,ipySigma(NetworkX + Web),Netwulf(交互式),nxviz(Matplotlib绑定),Py3plex(复杂网络分析),Py4cytoscape(Python+Cytoscape),pydot(Graphviz接口),PyGraphistry(GPU加速),python-igraph,pyvis(交互式图形),SNAP(大规模网络分析)。绘制和理解网络图从未如此简单!
  • 06.25 12:14:34
    发表了文章 2024-06-25 12:14:34

    2024年6月上半月30篇大语言模型的论文推荐

    大语言模型(LLMs)在近年来取得了快速发展。本文总结了2024年6月上半月发布的一些最重要的LLM论文,可以让你及时了解最新进展。
  • 06.24 11:01:51
    发表了文章 2024-06-24 11:01:51

    特征工程与数据预处理全解析:基础技术和代码示例

    在机器学习和数据科学的世界里,数据的质量是建模成功与否的关键所在。这就是特征工程和数据预处理发挥作用的地方。本文总结的这些关键步骤可以显著提高模型的性能,获得更准确的预测,我们将深入研究处理异常值、缺失值、编码、特征缩放和特征提取的各种技术。
  • 06.23 11:15:39
    发表了文章 2024-06-23 11:15:39

    2024年6月计算机视觉论文推荐:扩散模型、视觉语言模型、视频生成等

    6月还有一周就要结束了,我们今天来总结2024年6月上半月发表的最重要的论文,重点介绍了计算机视觉领域的最新研究和进展。
  • 06.22 11:02:20
    发表了文章 2024-06-22 11:02:20

    使用粒子滤波(particle filter)进行视频目标跟踪

    粒子滤波是一种贝叶斯滤波方法,主要用于非线性、非高斯动态系统中的状态估计。它通过使用一组随机样本(称为粒子)来表示状态的后验概率分布,并通过这些粒子的加权平均来估计状态。
  • 06.21 11:01:05
    发表了文章 2024-06-21 11:01:05

    HUSKY:一个优化大语言模型多步推理的新代理框架

    HUSKY是开源语言代理,专注复杂任务处理,如数字、表格及知识推理。通过多步计划和专家模型执行,它能迭代解决问题。在多模态任务中,即使使用小型模型,HUSKY也能匹敌GPT-4。训练涉及教师模型创建解决方案轨迹,以泛化处理广泛任务。在数值、表格和知识推理任务上表现出色,通过整合高效模型,HUSKY展示了在复杂推理领域的潜力。
  • 06.20 11:27:22
    发表了文章 2024-06-20 11:27:22

    使用深度强化学习预测股票:DQN 、Double DQN和Dueling Double DQN对比和代码示例

    深度强化学习可以将深度学习与强化学习相结合:深度学习擅长从原始数据中学习复杂的表示,强化学习则使代理能够通过反复试验在给定环境中学习最佳动作。通过DRL,研究人员和投资者可以开发能够分析历史数据的模型,理解复杂的市场动态,并对股票购买、销售或持有做出明智的决策。
  • 06.19 10:49:30
    发表了文章 2024-06-19 10:49:30

    goldfish loss:减少训练数据泄漏,提高大语言模型输出的多样性

    LLMs(大型语言模型)能够记忆并重复它们的训练数据,这可能会带来隐私和版权风险。为了减轻记忆现象,论文作者引入了一种名为"goldfish loss"的微妙修改,在训练过程中,随机抽样的一部分标记被排除在损失计算之外。这些被舍弃的标记不会被模型记忆,从而防止模型完整复制训练集中的一整个标记序列。
  • 06.18 10:23:28
    发表了文章 2024-06-18 10:23:28

    Multi-Head RAG:多头注意力的激活层作为嵌入进行文档检索

    现有的RAG解决方案可能因为最相关的文档的嵌入可能在嵌入空间中相距很远,这样会导致检索过程变得复杂并且无效。为了解决这个问题,论文引入了多头RAG (MRAG),这是一种利用Transformer的多头注意层的激活而不是解码器层作为获取多方面文档的新方案。
  • 06.17 12:33:53
    发表了文章 2024-06-17 12:33:53

    MLOps模型部署的三种策略:批处理、实时、边缘计算

    机器学习运维(MLOps)是一组用于自动化和简化机器学习(ML)工作流程和部署的实践。所选择的部署策略可以显著影响系统的性能和效用。所以需要根据用例和需求,采用不同的部署策略。在这篇文章中,我们将探讨三种常见的模型部署策略:批处理、实时和边缘计算。
  • 06.16 09:56:37
    发表了文章 2024-06-16 09:56:37

    Pixel Transformer:用像素代替补丁可以提升图像分类精度

    **Pixel Transformer** 挑战了ViT的16×16像素块范式,将每个像素作为独立令牌,消除局部偏置。在多种任务中,包括图像分类和生成,性能显著提升,尤其是在CIFAR-100和ImageNet上。通过单像素处理,模型能捕获更精细细节,增强泛化能力。尽管计算复杂性增加,但研究表明这种方法有潜力推动视觉模型和跨模态学习的发展。[[https://avoid.overfit.cn/post/558881d4b25b4e9e944806441eaf887a]]
  • 06.15 10:49:41
    发表了文章 2024-06-15 10:49:41

    SOFTS: 时间序列预测的最新模型以及Python使用示例

    这是2024年4月《SOFTS: Efficient Multivariate Time Series Forecasting with Series-Core Fusion》中提出的新模型,采用集中策略来学习不同序列之间的交互,从而在多变量预测任务中获得最先进的性能。
  • 06.14 10:21:12
    发表了文章 2024-06-14 10:21:12

    使用‘消除’技术绕过LLM的安全机制,不用训练就可以创建自己的nsfw模型

    本文探讨了一种名为“abliteration”的技术,该技术能够在不重新训练大型语言模型(LLM)的情况下移除其内置的安全审查机制。通常,LLM在接收到潜在有害输入时会拒绝执行,但这一安全特性牺牲了模型的灵活性。通过对模型残差流的分析,研究人员发现可以识别并消除导致拒绝行为的特定方向,从而允许模型响应所有类型的提示。
  • 06.13 10:49:46
    发表了文章 2024-06-13 10:49:46

    通过元学习优化增益模型的性能:基础到高级应用总结

    在当今数据驱动的决策过程中,因果推断和增益模型扮演了至关重要的角色。因果推断帮助我们理解不同变量间的因果关系,而增益模型则专注于评估干预措施对个体的影响,从而优化策略和行动。然而,要提高这些模型的精确度和适应性,引入元学习器成为了一个创新的解决方案。元学习器通过将估计任务分解并应用不同的机器学习技术,能够有效增强模型的表现。接下来,我们将详细探讨如何利用元学习优化增益模型的性能,特别是通过S-Learner、T-Learner和X-Learner这几种估计器。
  • 06.12 12:05:48
    发表了文章 2024-06-12 12:05:48

    使用PyTorch Profiler进行模型性能分析,改善并加速PyTorch训练

    加速机器学习模型训练是工程师的关键需求。PyTorch Profiler提供了一种分析工具,用于测量CPU和CUDA时间,以及内存使用情况。通过在训练代码中嵌入分析器并使用tensorboard查看结果,工程师可以识别性能瓶颈。Profiler的`record_function`功能允许为特定操作命名,便于跟踪。优化策略包括使用FlashAttention或FSDP减少内存使用,以及通过torch.compile提升速度。监控CUDA内核执行和内存分配,尤其是避免频繁的cudaMalloc,能有效提升GPU效率。内存历史记录分析有助于检测内存泄漏和优化批处理大小。
  • 06.11 11:15:03
    发表了文章 2024-06-11 11:15:03

    Tiny Time Mixers (TTM)轻量级时间序列基础模型:无需注意力机制,并且在零样本预测方面表现出色

    IBM研究人员提出Tiny Time Mixers (TTM),这是一个轻量级、基于mlp的TS模型,参数量小于1M,在M4数据集上表现优于大型SOTA模型,且具备优秀的零样本预测能力。TTM无注意力机制,利用TSMixer进行多级建模,自适应补丁和频率前缀调整等创新特性提升性能。预训练和微调阶段各有独特设计,预训练仅用单变量序列,微调时学习多变量依赖。TTM在某些任务中证明了小模型的优越性,且模型已开源。
  • 06.10 12:11:33
    发表了文章 2024-06-10 12:11:33

    如何应对缺失值带来的分布变化?探索填充缺失值的最佳插补算法

    该文探讨了缺失值插补的不同方法,比较了它们恢复数据真实分布的效果。文章指出,处理插补尤其在小样本或复杂数据时是个挑战,需要选择能适应数据分布变化的方法。文中介绍了完全随机缺失(MCAR)、随机缺失(MAR)和非随机缺失(MNAR)三种机制,并以一个简单的例子展示了数据分布变化。文章通过比较均值插补、回归插补和高斯插补,强调了高斯插补在重现数据分布方面更优。评估插补方法时,不应仅依赖于RMSE,而应关注分布预测,使用如能量距离这样的指标。此外,即使在随机缺失情况下,数据分布也可能因模式变化而变化,需要考虑适应这些变化的插补方法。
  • 06.09 10:32:43
    发表了文章 2024-06-09 10:32:43

    数据并非都是正态分布:三种常见的统计分布及其应用

    这篇文章除了介绍线性模型在减肥app预测中的不切实际性,还探讨了不同统计分布在体重管理和数据分析中的应用。文章提到了正态分布和泊松分布,前者常用于描述围绕平均值对称分布的连续数据,如体重;后者适合计数数据,如体重变化次数。正态分布以其钟形曲线闻名,泊松分布则描述独立事件的数量。文章还简要介绍了卡方分布在检验分类变量关系时的作用。最后,文章指出了在线性回归中假设数据正态分布的原因,包括便于统计推断和最小化估计误差。
  • 06.08 10:04:45
    发表了文章 2024-06-08 10:04:45

    Block Transformer:通过全局到局部的语言建模加速LLM推理

    Block Transformer是一种优化自回归语言模型推理效率的新架构,通过块级自注意力来平衡全局和局部依赖,提高吞吐量。模型包含嵌入器、块解码器和令牌解码器,其中块解码器处理全局依赖,令牌解码器处理局部细节。这种方法减轻了KV缓存的延迟和内存开销,尤其是在长序列处理中。实验显示,尽管Block Transformer参数量增加,但推理速度显著提升,尤其是在大块长度和优化的组件比例下,实现了性能与速度的平衡。
  • 06.07 11:33:06
    发表了文章 2024-06-07 11:33:06

    CNN依旧能战:nnU-Net团队新研究揭示医学图像分割的验证误区,设定先进的验证标准与基线模型

    在3D医学图像分割领域,尽管出现了多种新架构和方法,但大多未能超越2018年nnU-Net基准。研究发现,许多新方法的优越性未经严格验证,揭示了验证方法的不严谨性。作者通过系统基准测试评估了CNN、Transformer和Mamba等方法,强调了配置和硬件资源的重要性,并更新了nnU-Net基线以适应不同条件。论文呼吁加强科学验证,以确保真实性能提升。通过nnU-Net的变体和新方法的比较,显示经典CNN方法在某些情况下仍优于理论上的先进方法。研究提供了新的标准化基线模型,以促进更严谨的性能评估。
  • 06.06 11:38:29
    发表了文章 2024-06-06 11:38:29

    从提示工程到代理工程:构建高效AI代理的策略框架概述

    该文探讨了AI代理的发展,特别是ChatGPT等模型如何展示了AI系统的潜力。文章提出从提示工程转向代理工程,定义了代理能力需求,并提出一个框架来设计和实施AI代理。代理工程涉及明确代理的任务、所需行动、能力及熟练度,通过现有技术满足这些需求。文章强调了广泛和特定知识的熟练度、精确信息获取以及代理的结构设计和协调。随着技术进步,该框架为AI代理的未来发展提供了基础。
  • 06.05 11:01:06
    发表了文章 2024-06-05 11:01:06

    一切模型皆可联邦化:高斯朴素贝叶斯代码示例

    一般情况下我们对联邦学习的理解都是大模型和深度学习模型才可以进行联邦学习,其实基本上只要包含参数的机器学习方法都可以使用联邦学习的方法保证数据隐私
  • 06.04 11:46:48
    发表了文章 2024-06-04 11:46:48

    为什么你的RAG不起作用?失败的主要原因和解决方案

    企业在尝试使用检索增强生成(RAG)时遇到困难,因为系统效果不佳且难以优化。问题主要源于语义不协调,即任务理解与底层知识间的不一致。由于向量嵌入技术的不透明性,诊断和解决这个问题变得复杂。本文旨在揭示RAG失败的原因并提供改进策略。文章探讨了RAG的工作原理,强调了语义不协调的影响,并介绍了如何通过增加结构化数据和使用语义+相关性排名来提升RAG性能。此外,建议将AI视为工具而非完整解决方案,并提醒读者当前技术仍处早期阶段,需注意挑战。
  • 06.03 10:56:12
    发表了文章 2024-06-03 10:56:12

    2024年5月第四周LLM重要论文总结

    本文总结了2024年5月第四周发表的一些最重要的LLM论文。这些论文的主题包括模型优化和缩放到推理、基准测试和增强性能。
  • 06.02 09:52:31
    发表了文章 2024-06-02 09:52:31

    通过f-string编写简洁高效的Python格式化输出代码

    Python 3.6中引入的f-string是Python中最常用的特征之一,它可以让我们编写更干净、更高效和更易于维护的代码,我们今天就由浅入深来详细介绍使用它的一些技巧。
  • 06.01 12:31:48
    发表了文章 2024-06-01 12:31:48

    YOLOv10的改进、部署和微调训练总结

    YOLOv10在实时目标检测中提升性能与效率,通过无NMS训练解决延迟问题,采用一致的双任务和效率-精度驱动的模型设计。YOLOv10-S比RT-DETR-R18快1.8倍,YOLOv10-B比YOLOv9-C延迟减少46%。新方法包括一致性双标签分配,优化计算冗余和增强模型能力。实验结果显示YOLOv10在AP和延迟上均有显著改善。文章还提供了部署和微调YOLOv10的示例代码。

2024年05月

  • 05.31 10:23:55
    发表了文章 2024-05-31 10:23:55

    长序列中Transformers的高级注意力机制总结

    Transformers在处理长序列时面临注意力分散和噪音问题,随着序列增长,注意力得分被稀释,影响相关上下文表示。文章探讨了序列长度如何影响注意力机制,并提出了多种解决方案:局部敏感哈希减少计算需求,低秩注意力通过矩阵分解简化计算,分段注意力将输入分割处理,层次化注意力逐级应用注意力,递归记忆增强上下文保持,带有路由的注意力机制动态调整信息流,以及相对位置编码改进序列理解。这些方法旨在提高Transformer在长序列任务中的效率和性能。
  • 05.30 11:02:54
    发表了文章 2024-05-30 11:02:54

    通过强化学习策略进行特征选择

    本文探讨了使用强化学习策略进行特征选择以提升机器学习模型性能。强调在高维数据集中,有效选择特征至关重要。文章介绍了马尔可夫决策过程在强化学习中的应用,并提出了一种新的特征选择方法。通过定义状态(特征子集)、动作(添加特征)、奖励(如准确性提升),建立了一个RL模型。此外,还介绍了Python库FSRLearning,用于实现这一方法。文中展示了如何使用该库,并通过与 sklearn 的 RFE 方法比较,证明了RL方法在选择模型特征方面的优越性。
  • 05.29 10:49:15
    发表了文章 2024-05-29 10:49:15

    微调真的能让LLM学到新东西吗:引入新知识可能让模型产生更多的幻觉

    研究表明,大型语言模型通过微调获取新知识可能引发幻觉,降低性能,尤其是当处理未知事实时。模型倾向于利用已有知识而非真正学习新知识。已知事实能提升性能,而未知事实则在后期微调中损害性能。使用“我不知道”来标记未知知识可减轻负面影响。最佳结果来自处理可能已知的事实,而非极其知名的事实。微调对模型知识的更新存在风险,需谨慎处理新旧知识的融合问题。建议使用RAG和策略来克服微调限制。[阅读完整论文以了解更多](https://avoid.overfit.cn/post/21daac41f99042be804b381a6a9700fb)。
  • 05.27 11:34:00
    发表了文章 2024-05-27 11:34:00

    SUPRA:无须额外训练,将Transformer变为高效RNN,推理速度倍增

    `Transformers`模型因其在多种任务上的优秀性能而广泛采用,但其内存需求和推理成本随词元数量指数增长。为解决这一问题,论文《Linearizing Large Language Models》提出`SUPRA`方法,将预训练的`Transformers`转换为递归神经网络(RNN),实现有效推理并降低训练成本至原来的5%。`SUPRA`通过将注意力机制线性化并用`GroupNorm`替代`softmax`,保持预训练模型的优势。经过微调,转换后的模型在标准语言理解和长上下文任务中保持高性能,展示了在长序列处理方面的潜力,但仍有改进空间。
  • 05.26 10:37:37
    发表了文章 2024-05-26 10:37:37

    2024年5月大语言模型论文推荐:模型优化、缩放到推理、基准测试和增强性能

    本文汇总了2024年5月发布的七篇重要大语言模型论文,涉及模型优化、缩放、推理及性能增强。
  • 05.25 10:28:21
    发表了文章 2024-05-25 10:28:21

    2024年5月计算机视觉论文推荐:包括扩散模型、视觉语言模型、图像编辑和生成、视频处理和生成以及图像识别等各个主题

    五月发布的计算机视觉领域重要论文涵盖了扩散模型、视觉语言模型、图像生成与编辑及目标检测。亮点包括:1) Dual3D提出双模式推理策略,实现高效文本到3D图像生成;2) CAT3D利用多视图扩散模型创建3D场景,仅需少量图像;3) Hunyuan-DiT是多分辨率的中文理解扩散Transformer,可用于多模态对话和图像生成;4) 通过潜在扩散模型从EEG数据重建自然主义音乐,展示复杂音频重建潜力。此外,还有关于视觉语言模型和图像编辑的创新工作,如BlobGEN用于合成具有控制性的图像。
  • 05.24 10:49:13
    发表了文章 2024-05-24 10:49:13

    使用FP8加速PyTorch训练的两种方法总结

    在PyTorch中,FP8数据类型用于高效训练和推理,旨在减少内存占用和加快计算速度。虽然官方尚未全面支持,但在2.2版本中引入了`torch.float8_e4m3fn`和`torch.float8_e5m2`。文章通过示例展示了如何利用FP8优化Vision Transformer模型,使用Transformer Engine库提升性能,并探讨了PyTorch原生FP8支持的初步使用方法。实验表明,结合TE和FP8,训练速度可提升3倍,性能有显著增强,特别是在NVIDIA GPU上。然而,PyTorch的FP8支持仍处于试验阶段,可能带来不稳定性。
  • 05.23 09:58:55
    发表了文章 2024-05-23 09:58:55

    MambaOut:状态空间模型并不适合图像的分类任务

    该论文研究了Mamba架构(含状态空间模型SSM)在视觉任务(图像分类、目标检测、语义分割)中的必要性。实验表明,Mamba在这些任务中效果不如传统卷积和注意力模型。论文提出,SSM更适合长序列和自回归任务,而非视觉任务。MambaOut(不带SSM的门控CNN块)在图像分类上优于视觉Mamba,但在检测和分割任务中略逊一筹,暗示SSM在这类任务中可能仍有价值。研究还探讨了Mamba在处理长序列任务时的效率和局部信息整合能力。尽管整体表现一般,但论文为优化不同视觉任务的模型架构提供了新视角。
  • 05.22 12:24:19
    发表了文章 2024-05-22 12:24:19

    整合LlamaIndex与LangChain构建高级的查询处理系统

    该文阐述了如何结合LlamaIndex和LangChain构建一个扩展性和定制性强的代理RAG应用。LlamaIndex擅长智能搜索,LangChain提供跨平台兼容性。代理RAG允许大型语言模型访问多个查询引擎,增强决策能力和多样化回答。文章通过示例代码展示了如何设置LLM、嵌入模型、LlamaIndex索引及查询引擎,并将它们转换为LangChain兼容的工具,实现高效、精准的问题解答。通过多代理协作,系统能处理复杂查询,提高答案质量和相关性。
  • 05.20 09:47:35
    发表了文章 2024-05-20 09:47:35

    深入解析xLSTM:LSTM架构的演进及PyTorch代码实现详解

    xLSTM的新闻大家可能前几天都已经看过了,原作者提出更强的xLSTM,可以将LSTM扩展到数十亿参数规模,我们今天就来将其与原始的lstm进行一个详细的对比,然后再使用Pytorch实现一个简单的xLSTM。
  • 05.19 09:48:11
    发表了文章 2024-05-19 09:48:11

    DeepSparse: 通过剪枝和稀疏预训练,在不损失精度的情况下减少70%的模型大小,提升三倍速度

    该论文提出了一种新方法,用于创建高稀疏性大型语言模型,通过稀疏预训练和高效部署,在保持高准确度的同时显著提升处理速度。方法包括结合SparseGPT剪枝和稀疏预训练,实现70%稀疏度下准确率完全恢复,尤其适合复杂任务。实验显示,使用Cerebras CS-3 AI加速器和Neural Magic的DeepSparse、nm-vllm引擎,训练和推理速度有显著提升。此外,量化稀疏模型在CPU上速度提升可达8.6倍。这种方法优于传统剪枝,为构建更快、更小的语言模型提供了新途径,并通过开源代码和模型促进了研究复现和扩展。
  • 05.18 10:49:17
    发表了文章 2024-05-18 10:49:17

    扩散模型的多元化应用:药物发现、文本生成、时间序列预测等

    AlphaFold3是DeepMind的蛋白质结构预测软件,它引入扩散模型以提升预测准确性。扩散模型通过逐步添加和去除噪声来理解和生成数据,应用广泛,包括图像、音频、文本和时间序列数据的处理。在图像领域,它们擅长合成、编辑和超分辨率;在文本处理中,扩散模型在代码合成和问答任务中表现出色;在音频和视频生成方面也有重要应用;同时,它们在时间序列预测和增强模型鲁棒性方面也展现出潜力。随着技术发展,扩散模型将在更多领域发挥作用。
  • 05.17 10:37:25
    发表了文章 2024-05-17 10:37:25

    图神经网络入门示例:使用PyTorch Geometric 进行节点分类

    本文介绍了如何使用PyTorch处理同构图数据进行节点分类。首先,数据集来自Facebook Large Page-Page Network,包含22,470个页面,分为四类,具有不同大小的特征向量。为训练神经网络,需创建PyTorch Data对象,涉及读取CSV和JSON文件,处理不一致的特征向量大小并进行归一化。接着,加载边数据以构建图。通过`Data`对象创建同构图,之后数据被分为70%训练集和30%测试集。训练了两种模型:MLP和GCN。GCN在测试集上实现了80%的准确率,优于MLP的46%,展示了利用图信息的优势。
  • 05.16 10:46:58
    发表了文章 2024-05-16 10:46:58

    ATFNet:长时间序列预测的自适应时频集成网络

    ATFNet是一款深度学习模型,融合时域和频域分析,捕捉时间序列数据的局部和全局依赖。通过扩展DFT调整周期性权重,结合注意力机制识别复杂关系,优化长期预测。模型包含T-Block(时域)、F-Block(频域)和权重调整机制。实验证明其在时间序列预测任务中表现优越,已发布于arXiv并提供源代码。
  • 05.15 10:58:52
    发表了文章 2024-05-15 10:58:52

    时间序列预测:探索性数据分析和特征工程的实用指南

    时间序列分析在数据科学和机器学习中广泛应用于预测,如金融、能源消耗和销售。随着技术发展,除了传统统计模型,机器学习(如树模型)和深度学习(如LSTM、CNN和Transformer)也被应用。探索性数据分析(EDA)是预处理关键步骤,它通过Pandas、Seaborn和Statsmodel等Python库进行。本文展示了时间序列分析模板,包括描述性统计、时间图、季节图、箱形图、时间序列分解和滞后分析。使用Kaggle的小时能耗数据集,展示了如何通过这些方法揭示数据模式、季节性和趋势,为特征工程提供见解。
  • 05.13 10:09:30
    发表了文章 2024-05-13 10:09:30

    Transformers 加速的一些常用技巧

    Transformers架构因自注意力机制面临训练过程中的内存不足和GPU限制问题,主要源于大量参数、自注意力计算的高复杂度以及激活状态存储。为解决这些问题,常用策略包括:固定长度填充(使用注意力掩码处理填充部分)、动态填充(每批内序列长度相同)和等长匹配(按序列长度分组批量处理),以及自动混合精度(AMP)训练,通过float16降低内存使用和加速计算。尽管如此,大型模型仍可能需要高性能GPU支持。
  • 05.12 11:27:22
    发表了文章 2024-05-12 11:27:22

    You Only Cache Once:YOCO 基于Decoder-Decoder 的一个新的大语言模型架构

    YOCO是一种新的解码器-解码器架构,旨在解决大型语言模型推理时的内存限制问题。通过只缓存一次键值对,YOCO显著减少了GPU内存占用,与Transformer相比,内存使用降低了约L倍。模型由自解码器和交叉解码器组成,自解码器使用滑动窗口注意力,而交叉解码器利用全局KV缓存。实验表明,YOCO在保持竞争力的性能同时,提高了推理速度,尤其是在处理长序列时。此外,YOCO还减少了预填充时间,提升了吞吐量。
  • 05.11 12:12:42
    发表了文章 2024-05-11 12:12:42

    图机器学习入门:基本概念介绍

    图机器学习是机器学习的分支,专注于处理图形结构数据,其中节点代表实体,边表示实体间关系。本文介绍了图的基本概念,如无向图与有向图,以及图的性质,如节点度、邻接矩阵。此外,还讨论了加权图、自循环、多重图、双部图、异构图、平面图和循环图。图在描述数据关系和特征方面具有灵活性,为机器学习算法提供了丰富的结构信息。
  • 05.10 10:14:19
    发表了文章 2024-05-10 10:14:19

    使用PyTorch实现L1, L2和Elastic Net正则化

    本文介绍了机器学习中的正则化技术,包括L1、L2和Elastic Net,用于防止过拟合。L1正则化产生稀疏模型,适合特征选择;L2正则化使参数接近零但不为零,减少过拟合。Elastic Net结合L1和L2优点,适用于特征相关情况。在Python的sklearn库中,可使用Lasso、Ridge和ElasticNet类实现这些正则化。此外,文中提供PyTorch代码示例,展示了如何在多层感知机上应用L1、L2和Elastic Net正则化。
  • 发表了文章 2025-10-14

    LlamaIndex检索调优实战:分块、HyDE、压缩等8个提效方法快速改善答案质量

  • 发表了文章 2025-10-13

    斯坦福ACE框架:让AI自己学会写prompt,性能提升17%成本降87%

  • 发表了文章 2025-10-12

    氛围编程陷阱:为什么AI生成代码正在制造大量"伪开发者"

  • 发表了文章 2025-10-11

    12 种 Pandas 测试技巧,让数据处理少踩坑

  • 发表了文章 2025-10-10

    mmBERT:307M参数覆盖1800+语言,3万亿tokens训练

  • 发表了文章 2025-10-09

    vLLM 吞吐量优化实战:10个KV-Cache调优方法让tokens/sec翻倍

  • 发表了文章 2025-10-08

    vLLM推理加速指南:7个技巧让QPS提升30-60%

  • 发表了文章 2025-10-06

    向量存储vs知识图谱:LLM记忆系统技术选型

  • 发表了文章 2025-10-05

    NumPy广播:12个技巧替代循环,让数组计算快40倍

  • 发表了文章 2025-10-04

    Google开源Tunix:JAX生态的LLM微调方案来了

  • 发表了文章 2025-10-03

    从DQN到Double DQN:分离动作选择与价值评估,解决强化学习中的Q值过估计问题

  • 发表了文章 2025-10-02

    PINN训练新思路:把初始条件和边界约束嵌入网络架构,解决多目标优化难题

  • 发表了文章 2025-10-01

    Python离群值检测实战:使用distfit库实现基于分布拟合的异常检测

  • 发表了文章 2025-09-30

    Min-p采样:通过动态调整截断阈值让大模型文本生成兼顾创造力与逻辑性

  • 发表了文章 2025-09-29

    从零构建能自我优化的AI Agent:Reflection和Reflexion机制对比详解与实现

  • 发表了文章 2025-09-28

    从零构建短视频推荐系统:双塔算法架构解析与代码实现

  • 发表了文章 2025-09-27

    AI智能体框架怎么选?7个主流工具详细对比解析

  • 发表了文章 2025-09-26

    AI智能体开发实战:17种核心架构模式详解与Python代码实现

  • 发表了文章 2025-09-25

    Transformer自回归关键技术:掩码注意力原理与PyTorch完整实现

  • 发表了文章 2025-09-24

    从另一个视角看Transformer:注意力机制就是可微分的k-NN算法

正在加载, 请稍后...
滑动查看更多
正在加载, 请稍后...
暂无更多信息
正在加载, 请稍后...
暂无更多信息