首页
学习
活动
专区
工具
TVP
发布
精选内容/技术社群/优惠产品,尽在小程序
立即前往
  • 您找到你想要的搜索结果了吗?
    是的
    没有找到

    序列的相似性

    一般来说,相似性很高的两条序列往往具有同源关系。...但也有例外,即两条序列的相似性很高,但它们可能并不是同源序列,这两条序列的相似性可能是由随机因素所产生的,这在进化上称为“趋同”(convergence),这样一对序列可称为同功序列。...上面是两条序列相似性的一种定性表示方法,为了说明两条序列的相似程度,还需要定量计算。...用于序列相似性的打分矩阵(scoring matrix) 无论是3-1式还是3-2式,都是简单相似性评价模型,在计算比对的代价或得分时,对字符替换操作只进行统一的处理,没有考虑“同类字符”替换与“非同类字符...但在评估氨基酸替换频率时,应用了不同的策略。基本数据来源于BLOCKS数据库,其中包括了局部多重比对(包含较远的相关序列,与在PAM中使用较近的相关序列相反)。

    10610

    数据的属性与相似性

    第 k 列表示第 k 个属性,因此 x_{ik} 称为第 i 个数据对象的第 k 个属性值或分量。...二、属性的类型 (一)连续属性   在机器学习和数据挖掘领域,通常把属性粗略地分为连续型和离散型两大类,并在对它们的数据对象进行相似性度量时必须采用不同的度量方法。   ...区间标度值可以比较大小,定量评估任意值之间的差值。   例如,描述室外温度的属性是区间标度的。...三、相似度与相异度   两个数据对象之间的相似度(similarity)是两个对象相似性程度的一个度量值,取值区间通常为 [0,1] ,0表示两者不相似,1表示两者相同。   ...余弦相似度常常用来评价文档间的相似性。

    3700

    BUSCO 评估

    背景 用于转录组和基因组组装质量进行评估的软件,前面介绍了quast,今天的是busco,对于动物植物较大的基因组拼接结果评估,这个软件很好用。...busco简介 BUSCO(Benchmarking Universal Single-Copy Orthologs)主要用于转录组和基因组组装质量进行评估的软件。...BUSCO 对拼接结果的评估与 quast 不同,它并不追求基因组拼接的长度,而关注的是是否将一些单拷贝直系同源基因拼接出来。...BUSCO 评估的原理其实不难,软件根据 OrthoDB 数据库,构建了几个大的进化分支的单拷贝基因集。...包括基因组组装评估(all)、转录组组装评估(OGS)以及基因预测评估(trans) 其他选项 -sp :做 AUGUSTUS 用于训练的物种名字 -e :blast 的 e 值

    1.5K41

    初学数据挖掘——相似性度量(一)

    当然相似性度量远远不止这两种,http://www.chinaz.com/web/2011/1008/212684.shtml 在这里我找到了有关距离和相似性度量的一些算法。...坐标系怎么和相似性度量扯上联系呢?我们不妨假设一个场景。...我们需要根据对电影的评分来判断小明和小红是否兴趣相投或者兴趣相似,这时就是相似性度量。我们把小明在坐标轴上设为A点,对3部电影的评分分别代表3个维度,同理小红则设为B点。...这时候我们计算他们之间的欧几里得距离,他们之间的距离越长,说明他们两个的相似性越低,反之,相似度则越高。所以,欧几里得距离——就是坐标轴上两点之间的距离。   二:皮尔逊相关系数。这个就直接甩公式了。...),则相似度越大(相似度的数值越大)" 13 # 欧几里得距离 14 def sim_distance(prefs, person1, person2): 15 # 得到两者同时评价过的电影的列表

    1K80

    RDKit:化合物相似性搜索

    化合物相似性 化合物相似性在化学信息学和药物发现中具有悠久的历史,许多计算方法采用相似度测定来鉴定研究的新化合物。 分子相似性是许多虚拟筛选技术的理论基础。...分子相似性分析方法可以从整体上划分为全局方法和局部方法。局部相似性专注于分子拓扑结构上是否具有特定的官能团以及是否具有某些特定的对于分子识别至关重要的原子排布。...全局分子相似性总是与小分子的生物响应行为联系在一起,不断与生物活性紧密相关的分子特征做任何假设;但是,与生物活性无关特征被纳入考虑范围,无疑会对分子相似性评价产生负面影响。...基于分子相似性的虚拟筛选核心是“相似性假设”,这个假设首先由 Johnson 和 Maggiora提出,即结构类似的化合物具有类似的物化性质和生物活性,相似性方法在医药领域极具价值。...---- 本实例通过计算分子的Morgan指纹进行相似性比对。 ?

    1.3K30

    初学数据挖掘——相似性度量(二)

    这篇就来讲讲相似性算法在实际当中怎么用。第一:将指定的人与其他人作相似性比较,并从高到低进行排序;第二:对指定的人推荐未看过的电影。同样还是先给出具体分析,然后给出相应算法,再最后一起给出代码。   ...根据相似性从高到底排序。...这个算法比较简单,就是指定一人与每个人进行相似性度量,讲比较的结果存入一个list,然后进行排序、返回。   推荐未看过的电影。...return rankings 39 40 print u"推荐给Toby的电影" 41 print getRecommendations(critics, "Toby")   在这章中,相似性度度量算法使用了...“皮尔逊相关系数”,书中提到“选择不同的相似性度量方法,对结果的影响是微乎其微的”。

    1K60

    列表:创建列表

    列表是Tcl语言中最重要的一种数据结构。什么是列表?列表是元素的有序集合,各个元素可以包含任何字符串,例如空格,反斜杠,换行符等。...01 直接利用花括号{}创建 如图1所示,通过花括号的方式创建列表赋给变量a,列表长度为3(可通过llength查询列表长度,后续会介绍) ?...创建与图1相同的列表,采用list命令如图2所示。 ? 03 通过concat命令创建列表 concat的参数可以是任意多个列表,从而实现列表的拼接。...如图3所示,利用concat命令将图1的列表a与图2的列表b拼接为新的列表赋给c。图4显示了concat拼接3个列表,其中第一个列表是空列表。 ? ?...05 创建空列表 所谓空列表是指该列表是存在的,但不包含任何值。通常创建空列表用于列表初始化。可通过{}直接创建空列表,也可通过list命令创建空列表。 ?

    2.4K30
    领券