访问计数 63774 (自2016年5月)

我国正在建设创新型国家,软件创新创业的“互联网+”模式已成为新兴战略产业的重要形态。互联网软件开发呈现边界开放、群体分散、交付频繁、知识复杂等特征,同时具有全生命周期数据,形成了规模巨大、碎片分散、快速膨胀的软件数据。如何建立多源异质、广泛关联、语义丰富、覆盖全面的软件大数据环境,分析提炼软件知识,以提升软件开发智能化程度已成为重要科学问题。


本项目重点研究软件大数据汇聚组织、知识表示提炼、软件工具智能化和智能开发服务环境等关键技术,目标在于建立基于大数据的软件智能化开发技术体系,研发关键性的软件智能化开发工具,形成“人-工具-数据”融合的软件智能化开发环境,构建软件智能化开发云平台,面向万众创新的社会需求,运行服务大众的公共服务平台,面向企业创新能力提升,提供智能化的企业软件开发环境。


image


项目的研究内容归结为2 项共性基础技术、4 项关键技术和1 项总体技术:(1)共性基础技术包括软件大数据汇聚方法与技术和软件知识提炼方法与技术;(2)围绕软件开发的主要活动,从软件构造、测试验证、智能协作和运维演化4 个方面分别研究软件智能化开发技术,研发相应的软件工具;(3)总体技术方面,以云服务集成和软件大数据融合为目标,研究集成框架和机制,形成软件智能化开发云平台,面向大众服务和大型企业需求,分别构建公共服务平台和企业开发环境。


项目研究方案为“问题导向、数据汇聚、知识提炼、智能释放”,综合运用大数据和智能化技术实现软件开发方法和工具的智能化变革;融合国际主流工具和技术框架,关注于研究和实现“智能化机制”:

(1)以“主动感知、定向采集、多源关联、增量检测”机制构建自生长的软件大数据环境,拟采用基于云架构的混合型软件大数据存储与管理框架,通过数据分布式存储和并发查询提高访问效率;

(2)为实现领域分析、模型分析、程序理解、编码、测试、部署等不同软件开发任务中的智能化支持,拟采用知识图谱、经验案例、分类器、规则、模板与模式等多种知识表示方式,综合应用程序分析、自然语言处理、数据挖掘、信息检索等技术实现知识抽取;

(3)选择4 类开发活动中重要的关键支撑点,有针对性地确定数据、知识抽取、智能推荐和问答所需的技术、方法,研发相应的智能化工具;

(4)采取轻量级虚拟容器技术构建可扩展的工具运行支撑框架,并利用容器编排技术构建工具池运行管理机制;

(5)基于以分布式软件仓库为核心的工具集成框架构建智能开发工具环境,并采取多承租架构实现软件智能化开发工具的个性化数据管理。


项目研究团队由国内主要的软件工程学术研究单位和大型软件企业组成,形成“产学研”合作联合体,团队各成员单位持续在软件开发技术和支撑环境方面开展深入的技术研究和密切的产业实践合作,形成了良好的社会和经济效益。前期合作的成果获得了1 项国家技术发明二等奖和2项省部级一等奖,研发并运行提供服务的互联网软件开发服务平台(www.trustie.net)积累了大量的数据。


发布时间:2016-08-29 05:52
最后编辑:尹刚
3050?1465183419
指派给   陈晓婷
发布时间: 2017-01-20 14:47
更新时间:2017-01-20 15:15
描述如图
回复 ︿ (1)
  • 用户头像
    陈晓婷 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

0?1470885445
登录后可添加回复
3050?1465183419
指派给   陈晓婷
发布时间: 2017-01-20 14:41
更新时间:2017-01-20 15:07
描述如图
回复 ︿ (1)
  • 用户头像
    陈晓婷 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

0?1470885445
登录后可添加回复
3050?1465183419
指派给   陈晓婷
发布时间: 2017-01-18 17:18
更新时间:2017-01-20 11:16
sw_1是这个班级的学生
回复 ︿ (1)
  • 用户头像
    陈晓婷 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

0?1470885445
登录后可添加回复
12?1442652655
指派给   黄井泉
发布时间: 2017-01-19 13:46
更新时间:2017-01-20 10:35
回复 ︿ (1)
  • 用户头像
    黄井泉 9年前

    计划完成日期 被设置为 2017-01-20

    状态新增 变更为 已解决

    目标版本 被设置为 20170116-20170120 工作任务

    % 完成0 变更为 100

0?1470885445
登录后可添加回复
3050?1465183419
指派给   指导老师
发布时间: 2017-01-13 14:41
更新时间:2017-01-20 10:01
描述如图
回复 ︿ (3)
  • 用户头像
    指导老师 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

  • 用户头像
    黄井泉 9年前

    计划完成日期 被设置为 2017-01-20

    目标版本20170113周五上线版本 变更为 20170116-20170120 工作任务

    开始日期2017-01-13 变更为 2017-01-16

  • 用户头像
    孙涛 9年前

    附件 1.jpg 已添加

0?1470885445
登录后可添加回复
15715?1491492894
【缺陷】 爬虫内存优化 正常
指派给   张智雄
发布时间: 2017-01-20 09:55
更新时间:2017-01-22 12:25
目前,爬虫的工作流程可分为三个阶段:首先,抽取html,并存放在listhtml表中;然后,从listhtml表中读出相关数据,从中抽取url信息并存放于url表中;最后,从url表中读出数据,并据此抽取相关的detail信息。
可以发现,对于后两个阶段来说,最开始的工作都是先将上一阶段得到的数据从相关表中读入内存,再做信息的抽取工作。每一阶段的存库以及接下来的从数据库中读都将会带来开销。
而实际上,对于抽取的原始html信息,其实是没有太大的保存价值的。于是,这一部分的数据库存取所带来的开销完全可以节省出来。原本的三个流程可以缩减为两个:抽取html并立即从中抽取出url信息;抽取detail信息。优化前,爬虫的三个处理流程所带来的内存开销为:300M,200M,200M(以抽取stackoverflow为例)。优化后,不再执行原本由UrlExtractor负责的处理逻辑,因此可以达到节省内存开销的目的。
另外,对目前爬虫中包含的已经确认的无用代码和无用的包进行了精简。

回复 ︿ (1)
  • 用户头像
    张智雄 9年前

    <p> 描述有点问题。精简的操作应该是&nbsp;ListHtmlProcessor 和 ListHtmlPipeline 所包含的关于listhtml存库相关的操作。而Url的抽取移植到了第一步。。。 </p> <p> 在服务器上测试,内存减少约200M。 </p> <p> 代码已经上传至版本库zzx分支 </p>

0?1470885445
登录后可添加回复
3050?1465183419
指派给   黄井泉
发布时间: 2017-01-19 10:07
更新时间:2017-01-20 09:48
https://ucloudtest.trustie.net/users/test01/courses
回复 ︿ (1)
  • 用户头像
    黄井泉 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

0?1470885445
登录后可添加回复
3050?1465183419
指派给   黄井泉
发布时间: 2017-01-19 15:02
更新时间:2017-01-20 09:47
描述如图
回复 ︿ (2)
  • 用户头像
    黄井泉 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

  • 用户头像
    孙涛 9年前

    该问题应该是该用户无权限新建里程碑,是不是应该新建入口对没有权限操作的用户隐藏

0?1470885445
登录后可添加回复
12?1442652655
指派给   黄井泉
发布时间: 2017-01-19 18:02
更新时间:2017-01-19 18:02
回复 ︿
0?1470885445
登录后可添加回复
3050?1465183419
指派给   黄井泉
发布时间: 2016-11-10 16:30
更新时间:2017-01-19 18:01
如图的前后描述是一样的,“查看差别”毫无意义
回复 ︿ (2)
  • 用户头像
    黄井泉 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

  • 用户头像
    黄井泉 9年前

    计划完成日期 被设置为 2017-01-20

    目标版本20161111周五上线版本 变更为 20170116-20170120 工作任务

    开始日期2016-11-10 变更为 2017-01-16

0?1470885445
登录后可添加回复
点击展开更多