<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Charlotte · 技术札记</title><description>在数学与代码之间，记录学习，也分享思考。关于机器学习、深度学习、数学与生活的个人技术博客。</description><link>https://charlotte77.com/</link><language>zh-CN</language><item><title>【原】深度学习的一些经验总结和建议 | To do v.s Not To Do</title><link>https://charlotte77.com/posts/cnblogs-11224722/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-11224722/</guid><description>前言：本文同步发布于公众号：Charlotte数据挖掘，欢迎关注，获得最新干货～ 昨天看到几篇不同的文章写关于机器学习的to do &amp; not to do，有些观点赞同，有些不赞同，是现在算法岗位这么热门，已经不像几年前一样，可能跑过一些项目、懂点原理就可以了，现在对大家的要求更高，尤其工程能力更不可缺少，只…</description><pubDate>Sun, 21 Jul 2019 16:00:00 GMT</pubDate></item><item><title>深度学习分布式训练及CTR预估模型应用</title><link>https://charlotte77.com/posts/cnblogs-10898557/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-10898557/</guid><description>前言：我在github上创建了一个新的repo：PaddleAI, 准备用Paddle做的一系列有趣又实用的案例，所有的案例都会上传数据代码和预训练模型，下载后可以在30s内上手，跑demo出结果，让大家尽快看到训练结果，用小批量数据调试，再用全量数据跑模型，当然，也可以基于我上传的预训练模型进行迁移学习，如…</description><pubDate>Mon, 20 May 2019 16:00:00 GMT</pubDate></item><item><title>【机器学习】如何解决数据不平衡问题</title><link>https://charlotte77.com/posts/cnblogs-10455900/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-10455900/</guid><description>在机器学习的实践中，我们通常会遇到实际数据中正负样本比例不平衡的情况，也叫数据倾斜。对于数据倾斜的情况，如果选取的算法不合适，或者评价指标不合适，那么对于实际应用线上时效果往往会不尽人意，所以如何解决数据不平衡问题是实际生产中非常常见且重要的问题。 什么是类别不平衡问题 我们拿到一份数据时，如果是二分类问题，…</description><pubDate>Thu, 28 Feb 2019 16:00:00 GMT</pubDate></item><item><title>【资料总结】| Deep Reinforcement Learning 深度强化学习</title><link>https://charlotte77.com/posts/cnblogs-10311255/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-10311255/</guid><description>在机器学习中，我们经常会分类为有监督学习和无监督学习，但是尝尝会忽略一个重要的分支，强化学习。有监督学习和无监督学习非常好去区分，学习的目标，有无标签等都是区分标准。如果说监督学习的目标是预测，那么强化学习就是决策，它通过对周围的环境不断的更新状态，给出奖励或者惩罚的措施，来不断调整并给出新的策略。简单来说，…</description><pubDate>Tue, 22 Jan 2019 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】垃圾邮件处理实战（二）</title><link>https://charlotte77.com/posts/cnblogs-9143536/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-9143536/</guid><description>PaddlePaddle垃圾邮件处理实战（二） 前文回顾 在上篇文章中我们讲了如何用支持向量机对垃圾邮件进行分类，auc为73.3%，本篇讲继续讲如何用PaddlePaddle实现邮件分类，将深度学习方法运用到文本分类中。 构建网络模型 用PaddlePaddle来构建网络模型其实很简单，首先得明确paddl…</description><pubDate>Tue, 05 Jun 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】垃圾邮件处理实战（一）</title><link>https://charlotte77.com/posts/cnblogs-9071775/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-9071775/</guid><description>PaddlePaddle垃圾邮件处理实战（一） 背景介绍 在我们日常生活中，经常会受到各种垃圾邮件，譬如来自商家的广告、打折促销信息、澳门博彩邮件、理财推广信息等，一般来说邮件客户端都会设置一定的关键词屏蔽这种垃圾邮件，或者对邮件进行归类，但是总会有一些漏网之鱼。 不过，自己手动做一个垃圾邮件分类器也并不是什…</description><pubDate>Mon, 21 May 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】车牌识别实践（二）</title><link>https://charlotte77.com/posts/cnblogs-8646960/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8646960/</guid><description>上节我们讲了第一部分，如何用生成简易的车牌，这节课中我们会用PaddlePaddle来识别生成的车牌。 数据读取 在上一节生成车牌时，我们可以分别生成训练数据和测试数据，方法如下（完整代码在这里）： 1 # 将生成的车牌图片写入文件夹，对应的label写入label.txt 2 def genBatch(se…</description><pubDate>Sat, 24 Mar 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】车牌识别实践（一）</title><link>https://charlotte77.com/posts/cnblogs-8431077/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8431077/</guid><description>小伙伴们，终于到了实战部分了！今天给大家带来的项目是用PaddlePaddle进行车牌识别。车牌识别其实属于比较常见的图像识别的项目了，目前也属于比较成熟的应用，大多数老牌厂家能做到准确率99%+。传统的方法需要对图像进行多次预处理再用机器学习的分类算法进行分类识别，然而深度学习发展起来以后，我们可以通过用C…</description><pubDate>Sun, 25 Feb 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】迁移学习Transfer Learning</title><link>https://charlotte77.com/posts/cnblogs-8399926/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8399926/</guid><description>在前面的文章中，我们通常是拿到一个任务，譬如图像分类、识别等，搜集好数据后就开始直接用模型进行训练，但是现实情况中，由于设备的局限性、时间的紧迫性等导致我们无法从头开始训练，迭代一两百万次来收敛模型，所以这个时候迁移学习就派上用场了。 什么是迁移学习？ 迁移学习通俗来讲，就是运用已有的知识来学习新的知识，核心…</description><pubDate>Wed, 31 Jan 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】PaddlePaddle可视化之VisualDL</title><link>https://charlotte77.com/posts/cnblogs-8358194/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8358194/</guid><description>上篇文章我们讲了如何对模型进行可视化，用的keras手动绘图输出CNN训练的中途结果，本篇文章将讲述如何用PaddlePaddle新开源的VisualDL来进行可视化。在讲VisualDL之前，我们先了解一下常用的Tensorflow的可视化工具---Tensorboard。 Tensorflow的可视化 T…</description><pubDate>Thu, 25 Jan 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】CNN模型的可视化</title><link>https://charlotte77.com/posts/cnblogs-8343700/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8343700/</guid><description>前面几篇文章讲到了卷积神经网络CNN，但是对于它在每一层提取到的特征以及训练的过程可能还是不太明白，所以这节主要通过模型的可视化来神经网络在每一层中是如何训练的。我们知道，神经网络本身包含了一系列特征提取器，理想的feature map应该是稀疏的以及包含典型的局部信息。通过模型可视化能有一些直观的认识并帮助…</description><pubDate>Tue, 23 Jan 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】一起来参加百度 PaddlePaddle AI 大赛吧！</title><link>https://charlotte77.com/posts/cnblogs-8192571/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8192571/</guid><description>写这个系列写了两个月了，对paddlepaddle的使用越来越熟悉，不过一直没找到合适的应用场景。最近百度搞了个AI大赛，据说有四个赛题，现在是第一个----综艺节目精彩片段预测 ，大家可以去检测一下最近的学习成果啊！还有丰厚的奖金10W元软妹币哦！ 这是啥比赛？ 看比赛的要求，是希望参赛选手使用Paddle…</description><pubDate>Wed, 03 Jan 2018 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】用Tensorflow实现GoogLeNet InceptionV2/V3/V4</title><link>https://charlotte77.com/posts/cnblogs-8127780/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8127780/</guid><description>上一篇文章我们引出了GoogLeNet InceptionV1的网络结构，这篇文章中我们会详细讲到Inception V2/V3/V4的发展历程以及它们的网络结构和亮点。 GoogLeNet Inception V2 GoogLeNet Inception V2在《Batch Normalization: A…</description><pubDate>Tue, 26 Dec 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】用Tensorflow实现经典CNN网络GoogLeNet</title><link>https://charlotte77.com/posts/cnblogs-8066867/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8066867/</guid><description>前面讲了LeNet、AlexNet和Vgg，这周来讲讲GoogLeNet。GoogLeNet是由google的Christian Szegedy等人在2014年的论文《Going Deeper with Convolutions》提出，其最大的亮点是提出一种叫Inception的结构，以此为基础构建GoogL…</description><pubDate>Tue, 19 Dec 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】用Tensorflow实现经典CNN网络Vgg</title><link>https://charlotte77.com/posts/cnblogs-8028651/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-8028651/</guid><description>上周我们讲了经典CNN网络AlexNet对图像分类的效果，2014年，在AlexNet出来的两年后，牛津大学提出了Vgg网络，并在ILSVRC 2014中的classification项目的比赛中取得了第2名的成绩（第一名是GoogLeNet，也是同年提出的）。在论文《Very Deep Convolutio…</description><pubDate>Tue, 12 Dec 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】用Tensorflow实现经典CNN网络AlexNet</title><link>https://charlotte77.com/posts/cnblogs-7987904/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7987904/</guid><description>上周我们用PaddlePaddle和Tensorflow实现了图像分类，分别用自己手写的一个简单的CNN网络simple_cnn和LeNet-5的CNN网络识别cifar-10数据集。在上周的实验表现中，经过200次迭代后的LeNet-5的准确率为60%左右，这个结果差强人意，毕竟是二十年前写的网络结构，结果…</description><pubDate>Tue, 05 Dec 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】用Tensorflow进行图像分类</title><link>https://charlotte77.com/posts/cnblogs-7906363/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7906363/</guid><description>上个月发布了四篇文章，主要讲了深度学习中的“hello world”----mnist图像识别，以及卷积神经网络的原理详解，包括基本原理、自己手写CNN和paddlepaddle的源码解析。这篇主要跟大家讲讲如何用PaddlePaddle和Tensorflow做图像分类。所有程序都在我的github里，可以自…</description><pubDate>Tue, 28 Nov 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】卷积神经网络详解(二)——自己手写一个卷积神经网络</title><link>https://charlotte77.com/posts/cnblogs-7783261/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7783261/</guid><description>上篇文章中我们讲解了卷积神经网络的基本原理，包括几个基本层的定义、运算规则等。本文主要写卷积神经网络如何进行一次完整的训练，包括前向传播和反向传播，并自己手写一个卷积神经网络。如果不了解基本原理的，可以先看看上篇文章：【深度学习系列】卷积神经网络CNN原理详解(一)——基本原理 卷积神经网络的前向传播 首先我…</description><pubDate>Tue, 21 Nov 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】数据预处理</title><link>https://charlotte77.com/posts/cnblogs-7802226/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7802226/</guid><description>上篇文章讲了卷积神经网络的基本知识，本来这篇文章准备继续深入讲CNN的相关知识和手写CNN，但是有很多同学跟我发邮件或私信问我关于PaddlePaddle如何读取数据、做数据预处理相关的内容。网上看的很多教程都是几个常见的例子，数据集不需要自己准备，所以不需要关心，但是实际做项目的时候做数据预处理感觉一头雾水…</description><pubDate>Tue, 07 Nov 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】卷积神经网络CNN原理详解(一)——基本原理</title><link>https://charlotte77.com/posts/cnblogs-7759802/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7759802/</guid><description>上篇文章我们给出了用paddlepaddle来做手写数字识别的示例，并对网络结构进行到了调整，提高了识别的精度。有的同学表示不是很理解原理，为什么传统的机器学习算法，简单的神经网络(如多层感知机)都可以识别手写数字，我们要采用卷积神经网络CNN来进行别呢？CNN到底是怎么识别的？用CNN有哪些优势呢？我们下面…</description><pubDate>Tue, 31 Oct 2017 16:00:00 GMT</pubDate></item><item><title>三个月教你从零入门深度学习</title><link>https://charlotte77.com/posts/cnblogs-7735611/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7735611/</guid><description>最新更新：【深度学习系列】PaddlePaddle之手写数字识别（10.26更新） 【深度学习系列】卷积神经网络CNN原理详解(一)——基本原理（11.1更新） 【深度学习系列】PaddlePaddle之数据预处理（11.8更新） 【深度学习系列】卷积神经网络详解(二)——自己手写一个卷积神经网络（11.22…</description><pubDate>Wed, 25 Oct 2017 16:00:00 GMT</pubDate></item><item><title>【深度学习系列】手写数字识别实战</title><link>https://charlotte77.com/posts/cnblogs-7712856/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7712856/</guid><description>上周在搜索关于深度学习分布式运行方式的资料时，无意间搜到了paddlepaddle，发现这个框架的分布式训练方案做的还挺不错的，想跟大家分享一下。不过呢，这块内容太复杂了，所以就简单的介绍一下paddlepaddle的第一个“hello word”程序----mnist手写数字识别。下一次再介绍用Paddle…</description><pubDate>Sun, 22 Oct 2017 16:00:00 GMT</pubDate></item><item><title>Jaccard相似度在竞品分析中的应用</title><link>https://charlotte77.com/posts/cnblogs-7504251/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-7504251/</guid><description>上个月对一个小项目的效果进行改进，时间紧，只有不到一周的时间，所以思考了一下就用了最简单的方法来做，效果针对上一版提升了5%左右，跟大家分享一下（项目场景用的类似的场景） 项目场景：分析一个产品的竞品，譬如app的竞品、网站的竞品等等 项目分析：简单来说就是竞品分析，竞品分析有很多比较成熟的方法，但是我认为，…</description><pubDate>Sun, 10 Sep 2017 16:00:00 GMT</pubDate></item><item><title>如何用卷积神经网络CNN识别手写数字集？</title><link>https://charlotte77.com/posts/cnblogs-5671136/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5671136/</guid><description>前几天用CNN识别手写数字集，后来看到kaggle上有一个比赛是识别手写数字集的，已经进行了一年多了，目前有1179个有效提交，最高的是100%，我做了一下，用keras做的，一开始用最简单的MLP，准确率只有98.19%，然后不断改进，现在是99.78%，然而我看到排名第一是100%，心碎 = =，于是又改…</description><pubDate>Sun, 17 Jul 2016 16:00:00 GMT</pubDate></item><item><title>用Tensorflow让神经网络自动创造音乐</title><link>https://charlotte77.com/posts/cnblogs-5664523/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5664523/</guid><description>#————————————————————————本文禁止转载，禁止用于各类讲座及ppt中，违者必究————————————————————————# 前几天看到一个有意思的分享，大意是讲如何用Tensorflow教神经网络自动创造音乐。听起来好好玩有木有！作为一个Coldplay死忠粉，第一想法就是自动生成…</description><pubDate>Mon, 11 Jul 2016 16:00:00 GMT</pubDate></item><item><title>机器学习基础与实践（三）----数据降维之PCA</title><link>https://charlotte77.com/posts/cnblogs-5625984/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5625984/</guid><description>写在前面：本来这篇应该是上周四更新，但是上周四写了一篇深度学习的反向传播法的过程，就推迟更新了。本来想参考PRML来写，但是发现里面涉及到比较多的数学知识，写出来可能不好理解，我决定还是用最通俗的方法解释PCA，并举一个实例一步步计算，然后再进行数学推导，最后再介绍一些变种以及相应的程序。（数学推导及变种下次…</description><pubDate>Tue, 05 Jul 2016 16:00:00 GMT</pubDate></item><item><title>一文弄懂神经网络中的反向传播法——BackPropagation</title><link>https://charlotte77.com/posts/cnblogs-5629865/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5629865/</guid><description>最近在看深度学习的东西，一开始看的吴恩达的UFLDL教程，有中文版就直接看了，后来发现有些地方总是不是很明确，又去看英文版，然后又找了些资料看，才发现，中文版的译者在翻译的时候会对省略的公式推导过程进行补充，但是补充的又是错的，难怪觉得有问题。反向传播法其实是神经网络的基础了，但是很多人在学的时候总是会遇到一…</description><pubDate>Wed, 29 Jun 2016 16:00:00 GMT</pubDate></item><item><title>机器学习基础与实践（二）----数据转换</title><link>https://charlotte77.com/posts/cnblogs-5622325/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5622325/</guid><description>------------------------------------本博客所有内容以学习、研究和分享为主，如需转载，请联系本人，标明作者和出处，并且是非商业用途，谢谢！-------------------------------- 系列目录： 1 第一部分 模型的评估与数据处理 2 3 机器学习基础与实…</description><pubDate>Mon, 27 Jun 2016 16:00:00 GMT</pubDate></item><item><title>机器学习基础与实践（一）----数据清洗</title><link>https://charlotte77.com/posts/cnblogs-5606926/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5606926/</guid><description>------------------------------------本博客所有内容以学习、研究和分享为主，如需转载，请联系本人，标明作者和出处，并且是非商业用途，谢谢！-------------------------------- 想写这个系列很久了，最近刚好项目结束了闲下来有点时间，于是决定把之前学过…</description><pubDate>Wed, 22 Jun 2016 16:00:00 GMT</pubDate></item><item><title>【原】Spark之机器学习(Python版)(二)——分类</title><link>https://charlotte77.com/posts/cnblogs-5546032/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5546032/</guid><description>写这个系列是因为最近公司在搞技术分享，学习Spark，我的任务是讲PySpark的应用，因为我主要用Python，结合Spark，就讲PySpark了。然而我在学习的过程中发现，PySpark很鸡肋（至少现在我觉得我不会拿PySpark做开发）。为什么呢？原因如下： 1.PySpark支持的算法太少了。我们看…</description><pubDate>Mon, 30 May 2016 16:00:00 GMT</pubDate></item><item><title>【原】Learning Spark (Python版) 学习笔记(四)----Spark Sreaming与MLlib机器学习</title><link>https://charlotte77.com/posts/cnblogs-5518368/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5518368/</guid><description>本来这篇是准备5.15更的，但是上周一直在忙签证和工作的事，没时间就推迟了，现在终于有时间来写写Learning Spark最后一部分内容了。 第10-11 章主要讲的是Spark Streaming 和MLlib方面的内容。我们知道Spark在离线处理数据上的性能很好，那么它在实时数据上的表现怎么样呢？在实…</description><pubDate>Sun, 29 May 2016 16:00:00 GMT</pubDate></item><item><title>【机器学习Machine Learning】资料大全</title><link>https://charlotte77.com/posts/cnblogs-5488488/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5488488/</guid><description>昨天总结了深度学习的资料，今天把机器学习的资料也总结一下(友情提示：有些网站需要&quot;****&quot;^_^) 推荐几本好书： 1.Pattern Recognition and Machine Learning (by Hastie, Tibshirani, and Friedman&apos;s ) 2.Elements o…</description><pubDate>Thu, 12 May 2016 16:00:00 GMT</pubDate></item><item><title>【深度学习Deep Learning】资料大全</title><link>https://charlotte77.com/posts/cnblogs-5485438/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5485438/</guid><description>最近在学深度学习相关的东西，在网上搜集到了一些不错的资料，现在汇总一下： Free Online Books Deep Learning66 by Yoshua Bengio, Ian Goodfellow and Aaron Courville Neural Networks and Deep Learni…</description><pubDate>Wed, 11 May 2016 16:00:00 GMT</pubDate></item><item><title>【原】Learning Spark (Python版) 学习笔记(三)----工作原理、调优与Spark SQL</title><link>https://charlotte77.com/posts/cnblogs-5468968/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5468968/</guid><description>周末的任务是更新Learning Spark系列第三篇，以为自己写不完了，但为了改正拖延症，还是得完成给自己定的任务啊 = =。这三章主要讲Spark的运行过程（本地+集群），性能调优以及Spark SQL相关的知识，如果对Spark不熟的同学可以先看看之前总结的两篇文章： 【原】Learning Spark…</description><pubDate>Sat, 07 May 2016 16:00:00 GMT</pubDate></item><item><title>【原】Spark之机器学习(Python版)(一)——聚类</title><link>https://charlotte77.com/posts/cnblogs-5437611/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5437611/</guid><description>kmeans聚类相信大家都已经很熟悉了。在Python里我们用kmeans通常调用Sklearn包（当然自己写也很简单）。那么在Spark里能不能也直接使用sklean包呢？目前来说直接使用有点困难，不过我看到spark-packages里已经有了，但还没有发布。不过没关系，PySpark里有ml包，除了ml…</description><pubDate>Thu, 05 May 2016 16:00:00 GMT</pubDate></item><item><title>【原】Learning Spark (Python版) 学习笔记(二)----键值对、数据读取与保存、共享特性</title><link>https://charlotte77.com/posts/cnblogs-5437639/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5437639/</guid><description>本来应该上周更新的，结果碰上五一，懒癌发作，就推迟了 = =。以后还是要按时完成任务。废话不多说，第四章-第六章主要讲了三个内容：键值对、数据读取与保存与Spark的两个共享特性（累加器和广播变量）。 键值对（PaiRDD） 1.创建 1 #在Python中使用第一个单词作为键创建一个pairRDD,使用ma…</description><pubDate>Mon, 02 May 2016 16:00:00 GMT</pubDate></item><item><title>【原】Learning Spark (Python版) 学习笔记(一)----RDD 基本概念与命令</title><link>https://charlotte77.com/posts/cnblogs-5412709/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5412709/</guid><description>《Learning Spark》这本书算是Spark入门的必读书了，中文版是《Spark快速大数据分析》，不过豆瓣书评很有意思的是，英文原版评分7.4，评论都说入门而已深入不足，中文译版评分8.4，评论一片好评，有点意思。我倒觉得这本书可以作为官方文档的一个补充，刷完后基本上对Spark的一些基本概念、码简单…</description><pubDate>Wed, 20 Apr 2016 16:00:00 GMT</pubDate></item><item><title>【原】浅谈KL散度（相对熵）在用户画像中的应用</title><link>https://charlotte77.com/posts/cnblogs-5392052/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5392052/</guid><description>最近做用户画像，用到了KL散度，发现效果还是不错的，现跟大家分享一下，为了文章的易读性，不具体讲公式的计算，主要讲应用，不过公式也不复杂，具体可以看链接。 首先先介绍一下KL散度是啥。KL散度全称Kullback–Leibler divergence,也称为相对熵，信息增益，它是度量两个概率分布P与Q之间差异…</description><pubDate>Wed, 13 Apr 2016 16:00:00 GMT</pubDate></item><item><title>【原】KMeans与深度学习自编码AutoEncoder结合提高聚类效果</title><link>https://charlotte77.com/posts/cnblogs-5366578/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5366578/</guid><description>这几天在做用户画像，特征是用户的消费商品的消费金额，原始数据（部分）是这样的： 1 id goods_name goods_amount 2 1 男士手袋 1882.0 3 2 淑女装 2491.0 4 2 女士手袋 345.0 5 4 基础内衣 328.0 6 5 商务正装 4985.0 7 5 时尚 96…</description><pubDate>Thu, 07 Apr 2016 16:00:00 GMT</pubDate></item><item><title>【原】Spark学习总结-六个专题</title><link>https://charlotte77.com/posts/cnblogs-5357916/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5357916/</guid><description>最近从hadoop转向Spark了，学了一段时间了，准备写个专题，主要写pySpark的应用，主要计划是： 主题 内容概要 聚类（5.6） 1.几种常用的聚类算法；2.pyspark中聚类算法的应用（2-3个实例） 分类&amp;回归 1.几种常用的分类和回归算法；2.pyspark中分类和回归算法的应用（各一例） …</description><pubDate>Tue, 05 Apr 2016 16:00:00 GMT</pubDate></item><item><title>【原】数据分析/数据挖掘 入门级选手建议</title><link>https://charlotte77.com/posts/cnblogs-5340336/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5340336/</guid><description>1.数据分析和数据挖掘联系和区别 联系：都是搞数据的 区别：数据分析偏统计，可视化，出报表和报告，需要较强的表达能力。数据挖掘偏算法，重模型，需要很深的代码功底，要码代码，很多= =。 2.怎么入门 请百度“如何成为一名数据分析师”或者“如何成为一名数据挖掘工程师”。英文好上Quora，不行上知乎，看看入门资…</description><pubDate>Wed, 30 Mar 2016 16:00:00 GMT</pubDate></item><item><title>【原】机器学习几个基本的问题</title><link>https://charlotte77.com/posts/cnblogs-5072321/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5072321/</guid><description>从今年四月份到现在已经工作快9个月了，最开始是做推荐系统，然后做机器学习，现在是文本挖掘，每个部分研究的时间都不多，但还是遇到了很多问题，目前就把一定要总结的问题总结一下，以后有时间多看看，提醒自己看有没有解决。 推荐系统： 1.冷启动热启动区别和联系？各个阶段需要的算法？ 2.每个算法的数学推导、适用情况、…</description><pubDate>Wed, 23 Dec 2015 16:00:00 GMT</pubDate></item><item><title>【原】文本挖掘——特征选择</title><link>https://charlotte77.com/posts/cnblogs-5057316/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5057316/</guid><description>特征选择有很多方法，看了很多资料后，我总结了以下几种，以后有新内容会随时修改 1.DF——基于文档频率的特征提取方法 概念：DF（document frequency）指出现某个特征项的文档的频率。 步骤：1).从训练语料中统计出保函某个特征的文档频率（个数） 2).根据设定的阈值（min&amp;max），当该特征…</description><pubDate>Thu, 17 Dec 2015 16:00:00 GMT</pubDate></item><item><title>【原】python中文文本挖掘资料集合</title><link>https://charlotte77.com/posts/cnblogs-5029169/</link><guid isPermaLink="true">https://charlotte77.com/posts/cnblogs-5029169/</guid><description>这些网址是我在学习python中文文本挖掘时觉得比较好的网站，记录一下，后期也会不定期添加： 1.http://www.52nlp.cn/python-%E7%BD%91%E9%A1%B5%E7%88%AC%E8%99%AB-%E6%96%87%E6%9C%AC%E5%A4%84%E7%90%86-%E7%A…</description><pubDate>Mon, 07 Dec 2015 16:00:00 GMT</pubDate></item></channel></rss>