A PATH THROUGH THE GARDEN
大数据.
这里收录了 11 篇与「大数据」有关的文字。
对谷歌BERT模型的思考
why?BERT 可以用来干什么?处理这种非结构化的数据以及之前学习到的情感分析BERT 可以用于问答系统,情感分析,垃圾邮件过滤,命名实体识别,文档聚类等任务中,作为这些任务的基础设施即语言模型,what?是一个自然语言处理模型提出了“训练词向量”概念,这是独特之处BERT 利用了 Tran...
ANN神经网络
一、基本结构神经网络基本结构何为深度学习?二、感知器和激活函数感知器激活函数(其中w和x为向量点乘;b为偏置,w0)激活函数的选择三、感知器的训练四、简单代码实现from functools import reduce class Perceptron(object): ''' ...
时间格式UTC、GMT、GST
一、三者区别与关系UTC:世界标准时间协调世界时(英:Coordinated Universal Time ,法:Temps Universel Coordonné),又称世界统一时间,世界标准时间,国际协调时间。英文(CUT)和法文(TUC)的缩写不同,作为妥协,简称UTC。GMT:格林尼治...
数据的清洗和规整(二)
规整数据:连接、合并、重构、转换etc三、数据规整-连接-含索引数据连接 mergeimport pandas as pd import numpy as npdf_obj1 = pd.DataFrame('key': 'b', 'b', 'a', 'c', 'a', 'a', 'b',...
数据的清洗和规整(一)
清洗数据:删除指定数据、处理缺失数据etc一、数据预览:tail()、head()import numpy as np import pandas as pd df_obj = pd.DataFrame(np.random.randn(5,4), columns = 'a', 'b', 'c...
数据可视化
一、GitHub Juper NoteBook笔记https://github.com/wztlink1013/data-analysis-mining二、零碎总结matplotlib调整子图间距,调整整体空白fig.tight_layout() 调整整体空白 plt.subplots_ad...
Python的本地各类数据读取
一、TXT文件操作读取全部内容import numpy as np import pandas as pdtxt_filename = './files/python_wiki.txt' 打开文件 file_obj = open(txt_filename,'r') 读取整个文件内容...
Pandas库使用——基础知识
一、Pandas数据结构import pandas as pdSeries通过list构建Seriesser_obj = pd.Series(range(10, 20,2)) print (type(ser_obj)) print(ser_obj)
Numpy库使用
一、NumPyndarray 理解多维数组import numpy as np 生成指定维度的随机多维数据 数学建模应该用不到 data = np.random.rand(2, 3) print (data) print (type(data)) type是显示数据类型;shape显...
机器学习scikit-learn库的使用
一、机器学习的一些概念基本概念特征:一组数据的多个属性标签:人为指定特征监督学习:就像分类(离散化的标签),回归(连续性的标签)、【“有标准答案”】无监督学习:就像聚类【“无标准答案”】数据:是机器学习的命脉基本框架图二、机器学习的一些阶段/步骤sklearn相关提及官网scikit-lear...
爬虫架构和Scrapy框架使用
一、爬虫基本架构url管理模块就是管理自己爬取的的网页不要重复爬取,避免爬取进入死循环使用python当中的set数据结构网页下载模块将对应的url模块下载到本地或者读入内存实现方式通过url下载from urllib.request import urlopen test_url = "h...