访问计数 63736 (自2016年5月)

我国正在建设创新型国家,软件创新创业的“互联网+”模式已成为新兴战略产业的重要形态。互联网软件开发呈现边界开放、群体分散、交付频繁、知识复杂等特征,同时具有全生命周期数据,形成了规模巨大、碎片分散、快速膨胀的软件数据。如何建立多源异质、广泛关联、语义丰富、覆盖全面的软件大数据环境,分析提炼软件知识,以提升软件开发智能化程度已成为重要科学问题。


本项目重点研究软件大数据汇聚组织、知识表示提炼、软件工具智能化和智能开发服务环境等关键技术,目标在于建立基于大数据的软件智能化开发技术体系,研发关键性的软件智能化开发工具,形成“人-工具-数据”融合的软件智能化开发环境,构建软件智能化开发云平台,面向万众创新的社会需求,运行服务大众的公共服务平台,面向企业创新能力提升,提供智能化的企业软件开发环境。


image


项目的研究内容归结为2 项共性基础技术、4 项关键技术和1 项总体技术:(1)共性基础技术包括软件大数据汇聚方法与技术和软件知识提炼方法与技术;(2)围绕软件开发的主要活动,从软件构造、测试验证、智能协作和运维演化4 个方面分别研究软件智能化开发技术,研发相应的软件工具;(3)总体技术方面,以云服务集成和软件大数据融合为目标,研究集成框架和机制,形成软件智能化开发云平台,面向大众服务和大型企业需求,分别构建公共服务平台和企业开发环境。


项目研究方案为“问题导向、数据汇聚、知识提炼、智能释放”,综合运用大数据和智能化技术实现软件开发方法和工具的智能化变革;融合国际主流工具和技术框架,关注于研究和实现“智能化机制”:

(1)以“主动感知、定向采集、多源关联、增量检测”机制构建自生长的软件大数据环境,拟采用基于云架构的混合型软件大数据存储与管理框架,通过数据分布式存储和并发查询提高访问效率;

(2)为实现领域分析、模型分析、程序理解、编码、测试、部署等不同软件开发任务中的智能化支持,拟采用知识图谱、经验案例、分类器、规则、模板与模式等多种知识表示方式,综合应用程序分析、自然语言处理、数据挖掘、信息检索等技术实现知识抽取;

(3)选择4 类开发活动中重要的关键支撑点,有针对性地确定数据、知识抽取、智能推荐和问答所需的技术、方法,研发相应的智能化工具;

(4)采取轻量级虚拟容器技术构建可扩展的工具运行支撑框架,并利用容器编排技术构建工具池运行管理机制;

(5)基于以分布式软件仓库为核心的工具集成框架构建智能开发工具环境,并采取多承租架构实现软件智能化开发工具的个性化数据管理。


项目研究团队由国内主要的软件工程学术研究单位和大型软件企业组成,形成“产学研”合作联合体,团队各成员单位持续在软件开发技术和支撑环境方面开展深入的技术研究和密切的产业实践合作,形成了良好的社会和经济效益。前期合作的成果获得了1 项国家技术发明二等奖和2项省部级一等奖,研发并运行提供服务的互联网软件开发服务平台(www.trustie.net)积累了大量的数据。


发布时间:2016-08-29 05:52
最后编辑:尹刚
15715?1491492894
发帖时间:2017-02-16 22:37
更新时间:2017-02-16 22:37

抽取部分在服务器上部署时遇到一些问题:

1.openhub站点更新后,原来的某些字段抽取规则已经不再适用。需要修复一些已知的抽取问题

2.表结构无法适应openhub数据抽取结果,改了字段属性(既存问题)

3.服务器网络问题导致的页面下载失败。增加重试次数无法根治问题,后续需要完善代码,增加相应的错误处理应对办法。

4.其余字段抽取规则需要进一步复核

5.部署的抽取程序,存库数据经验证没问题(不过目前抽的都是老数据,实际上很多页面已经更新,不止页面结构,也包括页面信息,如项目描述、tags等)

回复 ︿
0?1470885445
登录后可添加回复
3050?1465183419
指派给   指导老师
发布时间: 2016-10-28 11:25
更新时间:2017-02-16 15:29
描述如题
回复 ︿ (5)
  • 用户头像
    指导老师 9年前

    % 完成0 变更为 100

  • 用户头像
    指导老师 9年前

    状态新增 变更为 关闭

  • 用户头像
    指导老师 9年前

    目前父回复无法被删除,只能先删除子回复再删除父回复

0?1470885445
登录后可添加回复
3050?1465183419
指派给   指导老师
发布时间: 2016-08-29 09:43
更新时间:2017-02-16 15:29
描述如题
回复 ︿ (5)
  • 用户头像
    指导老师 9年前

    % 完成0 变更为 100

  • 用户头像
    指导老师 9年前

    状态新增 变更为 关闭

  • 用户头像
    指导老师 9年前

    <p> 目前组织新建文章的KE与评论文章的KE能够截图<span class="atwho-inserted"><span class="at" data-user-id="12"><a href="/users/12">@黄井泉(Hjqreturn)</a></span></span>‍&nbsp; </p>

0?1470885445
登录后可添加回复
11879?1461414358
发帖时间:2017-02-15 23:32
更新时间:2017-02-16 09:35

1.增量数据的代码编写调试完成。

2.部署openhub抽取程序,openhub抽取程序仍报错 @张智雄

3.和湛大哥对接部署流程。


回复 ︿ (1)
  • 用户头像
    张智雄 9年前
    本机测试了一千条数据,没有复现报错过程。猜想会不会服务器的“特殊体质”触发了哪里的陷阱呀……

0?1470885445
登录后可添加回复
15715?1491492894
发帖时间:2017-02-15 23:25
更新时间:2017-02-15 23:25

目前已经将openhub_homepage问题解决方案推至主分支。

homepage的抽取结果已经正常。

测试中发现description的抽取结果均为空(140个项目页面),怀疑description字段的抽取规则有误。

回复 ︿
0?1470885445
登录后可添加回复
15712?1471931897
发帖时间:2017-02-15 23:17
更新时间:2017-02-15 23:17
今天依据昨天分析数据的结果编写程序并调试通过。但是在分析程序结果的过程中发现了github完全不同于其他社区项目的一些地方,比如名字的命名、描述信息的格式等,这些都需要重新设计别名提取规则,今天打开了思路,明天继续这项工作!
回复 ︿
0?1470885445
登录后可添加回复
12?1442652655
【缺陷】 消息结构优化 正常
指派给   指导老师
发布时间: 2017-02-12 20:33
更新时间:2017-02-15 10:54
比如:系统发出的加入班级的消息通知,点击后不会自动变成已读,封装成公共方法,可以先改动一处调用该方法,方法定义到application_helper中,否则总是修修补补很好时间,这个功能单独做一个,发PR审查。
回复 ︿ (1)
  • 用户头像
    指导老师 9年前

    状态新增 变更为 已解决

    % 完成0 变更为 100

0?1470885445
登录后可添加回复
11879?1461414358
发帖时间:2017-02-14 23:43
更新时间:2017-02-15 10:35

ossean去重-增量数据的代码编写调试

寒假那一版没有把增量数据额外考虑处理,增量数据即新汇总的项目,对于这些项目:

(1)查找匹配项目时应该搜索全表

(2)得到新的重复关系时,应该重新合并插入关系表,并删除以前的关系。

 ( 3)在处理新的合并关系时,要对比open_source_projects表中是否有关系中id,若有则更新项目数据,否则直接插入。



回复 ︿ (1)
  • 用户头像
    王涛 9年前
    <img src="http://forge.trustie.net/assets/kindeditor/plugins/emoticons/images/79.gif" alt="" border="0" /><img src="http://forge.trustie.net/assets/kindeditor/plugins/emoticons/images/79.gif" alt="" border="0" />

0?1470885445
登录后可添加回复
15715?1491492894
发帖时间:2017-02-14 23:35
更新时间:2017-02-15 10:34
1.查看和测试移洲哥写的关于openhub的homepage链接抽取问题修复的代码,和我自己写的一个修复实现进行比照(和学习前辈的经验技术),分析处理逻辑的合理性(处理效率,有效性,以及对现有代码的侵入性等)。目前有一个pull request 待处理。

2.检查抽取模块中其余网站的抽取规则是否有问题,看是否存在规则的不通用的问题。
回复 ︿ (1)
  • 用户头像
    王涛 9年前
    <img src="http://forge.trustie.net/assets/kindeditor/plugins/emoticons/images/79.gif" alt="" border="0" />加快完成第一点,并在今天晚上抽取数据更新

0?1470885445
登录后可添加回复
15712?1471931897
发帖时间:2017-02-14 23:21
更新时间:2017-02-15 10:34

    github项目的别名提取在春节期间就已经开始,而且已经编写出第一版代码,今天主要分析了第一版代码的运行结果并再次查看汇总表中原始的github项目,进一步分析别名提取规则该如何设定。

    今天的主要收获是通过对测试集(约两万条数据)数据的分析,得出了具有代表性的项目集,从而在这些项目集的基础上制定别名提取规则。

    具有明显特征的数据集主要有三类:

    1.项目短名(github项目命名形式一般为A/B,B即为其短名)去除短横线、下划线或其他特殊符号后可以做为别名的,这一类占据绝大多数。

    2.项目短名能够在项目描述信息中提取到全写或缩写的。

    3.项目短名和项目描述信息具有很大相似度的

    4.其他特征,由于较为零散,有待于进一步分析,将在解决前三类问题的情况下,视提取效果再定。

   具体特征数据集见附件。


回复 ︿ (1)
  • 用户头像
    王涛 9年前
    很好!<br />

0?1470885445
登录后可添加回复
点击展开更多