首页
学习
活动
专区
工具
TVP
发布
精选内容/技术社群/优惠产品,尽在小程序
立即前往

中的用户画像:中的用户模型

经历了6年的发展,已经成为了国内社交媒体的中坚力量。本文从的角度出发,对用户模型的目的、维度和建模任务进行描述,并作为后续用户模型相关文章的总述。...从自身的角度来讲,构建用户模型的目的包括: (1) 完善及扩充用户信息 用户模型的首要动机就是了解用户,这样才能够提供更优质的服务。...由此,我们可以将用户模型按照图1所示的四个维度进行划分,即属性维度、兴趣维度、社交维度和行为维度。 图1 用户模型的维度划分 用户属性和用户兴趣是通常用户画像中包含的两个维度。...接下来主要介绍一下画像中兴趣维度的构建方法。 2. 用户兴趣分析 (1) 标签来源 用户自标签、达人或认证标签、公司、学校、群标签、星座、关键词……这些来源都可能成为用户的标签。...小结 用户画像的目的是将用户信息标签化,本文中介绍针对本身的特点介绍用户画像的构建,该用户画像主要还是从的业务出发,完善用户信息和发掘用户兴趣,区分兴趣和能力,并形式化结构化表达出来。

3.9K100

数据挖掘:用户画像之用户标签

作为最大的中文社交媒体,拥有数以“PB”(1024 TB)计的用户信息,从海量的用户信息中发掘每个用户的社交特性、潜在能力及兴趣等信息,是用户提供更加人性化服务的基础。...同时,大数据的用户画像体系已应用于众多的业务场景中,并随着业务的发展不断完善升级,将“大数据”概念落地落实。...为了方便与大家交流探讨,大数据用户团队特别整理了用户画像系列文章,主要从的角度出发,重点介绍社交媒体平台中用户的特性,业务发展中用户的建模刚需,以及不同纬度建模过程中遇到的问题和解决方案。...引言 在以为代表的社交媒体平台中,每一个用户都是网络中的一个具备发布、传播、消费信息功能的节点。...二、能力标签的应用场景 目前能力标签已经应用于众多业务场景中,其中两个典型的业务场景是“找人”和“热门”,分别如图2和图3所示。 ?

9.9K80
您找到你想要的搜索结果了吗?
是的
没有找到

调用新浪显示用户信息

调用新浪显示用户信息 最近需要在开发的安卓项目中添加新浪一件关注的功能, 本来是一个很简单的功能, 就是调用新浪博客户端显示用户信息的 Activity , 然后用户就点击关注按钮就可以了。...首先我们需要使用 AXMLPrinter2.jar 反编译新浪的 AndroidManifest.xml , 从中查找显示用户信息的页面, 反编译代码如下: java -jar AXMLPrinter2...var chooseIntent = Intent.CreateChooser(intent, "Weibo"); StartActivity(chooseIntent); 上面代码的效果是: 如果用户没有安装新浪..., 则直接调用浏览器打开那个地址; 如果用户安装了新浪, 则会显示下面的对话框让用户选择: ?...再次鄙视一下新浪的开放程度, 居然有这个功能都不开放。

58320

爬取用户所有文章的爬虫

上发布的内容有的短文本+图片(也就是),还有视频,文章等形式,爬取用户可以使用之前的源代码文章:一个爬取用户所有的爬虫,还能断网续爬那种 本次分享的是如何爬取用户的所有文章。...下面以【共青团中央】为 target,抓取该账号发布的所有文章,大部分都是深度好文,值得保存起来细细品读。...保存数据时,一定要针对一些异常情况作处理,比如由于断网了,爬了几十万条数据在内存中没有持久化保存到文件中而丢失,这可就大亏特亏了,建议在执行具体的 requests 请求时加个 try...except...数量多的时候,可以考虑每翻 N 页面保存一次,不过文章数量一般比少多个,可以直接爬完保存,具体情况具体分析。...最近也会有较多爬虫相关的更新,请持续关注,在短视频爆炸的今天,原创图文内容不易,转发好看就是最大的支持~

2.3K41

【开放源代码】搜索用户爬虫

保证阅读体验,文中广告已关闭~ 超级方便的用户信息爬虫 是根据用户 Uid 来抓取公开的用户信息,但是很多时候,我们可能只知道这个用户名字,并不知道 Uid,本次开放的爬虫就是完成从用户名到...== 0: return -1 temp = users[0] uid = temp[temp.rindex('/') + 1:] return uid 类比用户信息爬虫...% 10 == 0: df.to_csv(file_path, index=False, encoding='utf-8-sig') 它会自动根据指定路径下的 csv 文件里的用户名抓取用户链接并保存到...比如我们有一个 test.csv ,其中用户名信息在 user_name 列,我们可以这样调用。...最后依旧是话题爬虫的日常更新,修复了群里朋友提出的若干问题,提升了稳定性。可以去 2021 新版话题爬虫发布 获取最新的话题爬虫。

98820

浅谈精准推荐——用户行为挖掘与相似用户挖掘

小编说:在推荐系统中,通过对用户数据的挖掘,抽象出用户感兴趣的“商品”,以文推荐为例,“商品”表现为用户文,在文精准推荐中,其核心问题是在给定的环境下,为用户推荐高质量且符合用户兴趣的文...图4 基于互动内容的兴趣挖掘 2 基于与主互动的兴趣挖掘 当用户A与待推荐主之间有过互动行为时,在一定程度上表明该用户主之间存在某种兴趣上的相似性,对于主发布的用户A互动的可能性比较大...在基于与主互动的兴趣挖掘中,是指将主的投放给与其互动过的一些用户。...在中,为了能够定向让某个人看到,我们会在这条中加入“@”该用户的标记。...当有需要投放时,选择某几个社区,将投放给社区中的住户,选择社区的方式有很多种,比如: 的主题与社区标签的匹配 主所在的社区 在基于社区的相似用户的挖掘中,利用Label Propagation

1.3K10

Python爬取新浪用户信息及内容

新浪作为新时代火爆的新媒体社交平台,拥有许多用户行为及商户数据,因此需要研究人员都想要得到新浪数据,But新浪数据量极大,获取的最好方法无疑就是使用Python爬虫来得到。...网上有一些关于使用Python爬虫来爬取新浪数据的教程,但是完整的介绍以及爬取用户所有数据信息比较少,因此这里分享一篇主要通过selenium包来爬取新浪用户数据的文章。...目标 爬取新浪用户数据,包括以下字段:id,昵称,粉丝数,关注数,数,每一篇的内容,转发数,评论数,点赞数,发布时间,来源,以及是原创还是转发。...3.获取用户页码 在登录之后可以进入想要爬取的商户信息,因为每个商户的量不一样,因此对应的页码也不一样,这里首先将商户的页码爬下来。...与此同时,将那些公用信息爬取下来,比如用户uid,用户名称,数量,关注人数,粉丝数目。 ?

1.3K20

登陆爬取用户影响力

下面的操作针对于 m.weibo.cn : 这里要实现的是对用户的影响力抓取,我本文以广电时评为例。 点击查看,里面的数据会更多一点。...未登陆时: 这里是需要用户登陆之后才可以查看的, 所以为了实现我们的需求,我们开始模拟登陆。...首先来到移动端的登陆页面 然后选择使用账号密码登陆 先输入一个错误的账号来查看一下登陆的接口 错误的账号返回了retcode 查看下 Formdata 当然请求头也不能忘记 有了这些信息之后...session.post(url=login_url, headers=headers, data=formdata).text) 输出之后,返回了 retcode,已经登陆成功 如果需要获取指定的影响力...我们可以通过接口 先访问用户api,获取用户主页的cid uid = 'ID' user_api = 'https://m.weibo.cn/api/container/getIndex?

26720

新浪用户画像是怎样构建的?

这个新浪的案例或许能告诉你正确答案。...1.概述 从上一篇《认识每一个“你”:中的用户模型》里面对用户模型维度的划分可以看出,属性和兴趣维度的用户模型都可以归入用户画像(User Profile)的范畴。...本身就有比较完整的用户注册引导、用户信息完善任务、认证用户审核、以及大量的合作对象等,在收集和清洗用户属性的过程中,需要注意的主要是标签的规范化以及不同来源信息的交叉验证。...接下来主要介绍一下画像中兴趣维度的构建方法。 2.用户兴趣分析 1 标签来源 用户自标签、达人或认证标签、公司、学校、群标签、星座、关键词……这些来源都可能成为用户的标签。...3.小结 用户画像的目的是将用户信息标签化,本文中介绍针对本身的特点介绍用户画像的构建,该用户画像主要还是从的业务出发,完善用户信息和发掘用户兴趣,区分兴趣和能力,并形式化结构化表达出来。

1.6K70

2014年用户发展报告(44PPT)

回复“2014”下载全版PPT 据2014年发布的第三季度财报中显示,截止2014年9月30日,月活跃用户数(MAU)已经达到1.67亿人,较上年同期增长36%;9月的日均活跃用户数(DAU...对比网民整体数据增长水平来看,平台下的用户增长率保持了较高的水平; 随着V6版本的推出,构建在平台上的各类应用功能以及应用场景不断丰富,用户的社交需求得到了进一步的满足。...同时,随着移劢端的迅猛収展,各种信息在平台下得以迅速传播扩散,的媒体价值得到了极大的凸显;鉴于此,数据中心特整理2014年用户发展报告,诠释用户整体収展状况,从宏观上解读用户的行为特性...超六成用户参与过热门话题讨论 平台向普通用户开放话题申请与主持权,提高了用户积极参与话题讨论的热情;热门电视节目宣传与企业营销活动常常采用话题形式,引导用户积极参与话题讨论;另外,社会热点事件成为的重要话题内容...近半数用户会通过链接进入网购网站 2013年,有近半数用户会通过链接进入网购网站进行网购,可见,已经成为电商网站(尤其淘宝)的导流入口之一。 ?

99720

Python调用API获取内容

一:获取app-key 和 app-secret     使用自己的账号登录开放平台,在开放中心下“创建应用”创建一个应用,应用信息那些随便填,填写完毕后,不需要提交审核,需要的只是那个app-key...三:安装 python SDK 有两种安装方式: 1:http://github.liaoxuefeng.com/sinaweibopy/下载新浪SDK 2:python有个简单的安装方式:直接在命令行下键入...: sudo pip install sinaweibopy 四:实例验证,获取当前登录用户及其所关注(授权)用户的最新 这里需要注意的是在浏览器弹出一个页面,要先点击“授权”(这里进行的OAuth...2认证,我理解为就是用户访问我的应用后将页面导向新浪服务器然后用户输入信息到新浪服务器后授权给我的应用访问用户数据,这里我将的授权给下面的程序了),授权后浏览器中的URL类似:https://api.weibo.com...以下为我的关注用户: ? ? ? ? 拿上边代码为例,这里我们获取的信息有: ?

3.4K41

亿级用户下的新浪平台架构

序言   新浪在2014年3月公布的月活跃用户(MAU)已经达到1.43亿,2014年新年第一分钟发送的博达808298条,如此巨大的用户规模和业务量,需要高可用(HA)、高并发访问、低延时的强大后台系统支撑...平台第一代架构为LAMP架构,数据库使用的是MyIsam,后台用的是php,缓存为Memcache。   ...我们先看一张的核心业务图(如下),是不是非常复杂?但这已经是一个简化的不能再简化的业务图了,第三代技术体系就是为了保障在核心业务上快速、高效、可靠地发布新产品新功能。 ?  ...,支持PB、JSON、二进制序列化协议,中最大的应用场景将中引用的视频、图片、文章统一定义为对象,一共定义了几十种对象类型,并抽象出标准的对象元数据Schema,对象的内容上传到对象存储系统(Sina...WatchMan大型分布式追踪系统   如其他大中型互联网应用一样,平台由众多的分布式组件构成,用户通过浏览器或移动客户端的每一个HTTP请求到达应用服务器后,会经过很多个业务系统或系统组件,并留下足迹

69820

亿级用户下的新浪平台架构

原文:http://www.infoq.com/cn/articles/weibo-platform-archieture 序言   新浪在2014年3月公布的月活跃用户(MAU)已经达到1.43亿...,2014年新年第一分钟发送的博达808298条,如此巨大的用户规模和业务量,需要高可用(HA)、高并发访问、低延时的强大后台系统支撑。   ...我们先看一张的核心业务图(如下),是不是非常复杂?但这已经是一个简化的不能再简化的业务图了,第三代技术体系就是为了保障在核心业务上快速、高效、可靠地发布新产品新功能。 ?  ...,支持PB、JSON、二进制序列化协议,中最大的应用场景将中引用的视频、图片、文章统一定义为对象,一共定义了几十种对象类型,并抽象出标准的对象元数据Schema,对象的内容上传到对象存储系统(Sina...WatchMan大型分布式追踪系统   如其他大中型互联网应用一样,平台由众多的分布式组件构成,用户通过浏览器或移动客户端的每一个HTTP请求到达应用服务器后,会经过很多个业务系统或系统组件,并留下足迹

2.5K20
领券