Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

pipeline-frameworks-cromwell-03.原生调度系统

发表于 2024-08-12 | 分类于 pipeline , framework , 编程拾慧 , python , 任务调度
需要注意几个点: cromwel在进行任务投递时,会构建一个临时的工作目录,用于存储任务的中间文件,因此,我们需要保证工作目录的权限和空间足够。 cromwell存储每个任务的状态和任务间的逻辑关系,如果没有部署数据库,这部分信息会存储到内存中,因此如果没有部署数据库,需要确保内存足够支撑任务的运 ...
阅读全文 »

pipeline-frameworks-cromwell-03.调度系统-oliver

发表于 2024-08-12 | 分类于 pipeline , framework , 编程拾慧 , python , 任务调度
oliver 1234oliver st -g MGISEQ-2000 -rd# -r Show jobs in the 'Running' state.# /jdfstj4/B2C_RD_R1/fuxiangke/wesLite/env/miniconda3/envs/cro ...
阅读全文 »

5020.大模型-模型优化

发表于 2024-08-09 | 分类于 LLM , 微调
自从大型语言模型(LLM)和先进的聊天模型发布以来,人们已经使用了各种技术来优化这些人工智能系统的输出,使其更适配本地化的数据和应用场景。其中 检索增强生成(RAG)和微调(Fine-tuning)是提升大语言模型性能的两种常用方法,除此之外还有提示工程,但是提示工程本身是调整的输入给大模型的信息, ...
阅读全文 »

特征工程-特征选择

发表于 2024-08-07 | 分类于 machine_learning
对于一个机器学习问题,数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限。由此可见,数据和特征在模型的整个开发过程中是比较重要。特征工程,顾名思义,是对原始数据进行一系列工程处理,将其提炼为特征,作为输入供算法和模型使用。从本质上来讲,特征工程是一个表示和展现数据的过程。在实际工作中,特征 ...
阅读全文 »

特征工程 - 概述

发表于 2024-08-07 | 分类于 machine_learning
对于一个机器学习问题,数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限。由此可见,数据和特征在模型的整个开发过程中是比较重要。特征工程,顾名思义,是对原始数据进行一系列工程处理,将其提炼为特征,作为输入供算法和模型使用。从本质上来讲,特征工程是一个表示和展现数据的过程。在实际工作中,特征 ...
阅读全文 »

特征工程-时间周期处理

发表于 2024-08-07 | 分类于 LLM
我们有一个带有日期类型列的 pandas 数据帧。利用这一列,我们可以创建以下特征: 年 年中的周 月 星期 周末 小时 还有更多 123456789101112# 添加'year'列,将 'datetime_column' 中的年份提取出来df.loc[ ...
阅读全文 »

特征工程 数据预处理-分类变量处理

发表于 2024-08-07 | 分类于 LLM
往往我们需要进行训练时,读取的特征是多种多样的,数值类型的变量可能只是其中的一部分(比如年龄),但是还会有一些其他类型的分类变量(比如性别,比如月份)。而我们这里讨论的分类变量/特征是指任何特征类型,可分为两大类: 无序变量: 是指有两个或两个以上类别的变量,这些类别没有任何相关顺序。例 ...
阅读全文 »

1020.性能评估-

发表于 2024-08-07 | 分类于 Tobeinsert
针对分类 准确率(Accuracy)准确率:这是机器学习中最直接的指标之一。它定义了模型的准确度。如果你建立的模型能准确分类100条数据中的90条数据,那么你的准确率就是 90% 或 0.90。评估的就是预测结果和真实结果的一致性。 12345678910111213141516# 从头实现def ...
阅读全文 »

1010.数据分组-交叉验证

发表于 2024-08-07 | 分类于 machine_learning
交叉检验是构建机器学习模型过程中的一个步骤,它可以帮助我们确保模型准确拟合数据,同时确保我们不会过拟合。起始随着深度学习的兴起,我们可以想想一下,只要我们的特征足够多,那么任何问题我们都可以在训练集达到 100% 的性能。甚至最极端的方法,我们的分析方法甚至于完全可以采用枚举的方法(当然这是不对的) ...
阅读全文 »

特征工程-数据标准化-sklearn

发表于 2024-08-07 | 分类于 machine_learning
数据标准化sklearn 数据标准化StandardScalerStandardScaler 通过去除均值并缩放至单位方差来标准化特征。数据粗粒逻辑为 $x_{fit} = (x_{row}-mean(x))/std(x)$ 1234from sklearn.preprocess ...
阅读全文 »
‹1…606162…94›

939 日志
108 分类
794 标签
© 2026 Ben-air
已有人访问 | 总访问次