主办: 上海立信会计金融学院

  • ISSN 2096-9554
  • CN 31-2074/F

留言板

尊敬的读者、作者、审稿人, 关于本刊的投稿、审稿、编辑和出版的任何问题, 您可以本页添加留言。我们将尽快给您答复。谢谢您的支持!

姓名
邮箱
手机号码
标题
留言内容
验证码

财务与会计领域的文本分析研究:回顾与展望

刘云菁 张紫怡 张敏

刘云菁, 张紫怡, 张敏. 2021. 财务与会计领域的文本分析研究:回顾与展望. 会计与经济研究, 35(1): 3-22.
引用本文: 刘云菁, 张紫怡, 张敏. 2021. 财务与会计领域的文本分析研究:回顾与展望. 会计与经济研究, 35(1): 3-22.
Liu Yunjing, Zhang Ziyi, Zhang Min. 2021. Text Analysis in the Research of Finance and Accounting: Review and Prospect. Accounting and Economic Research, 35(1): 3-22.
Citation: Liu Yunjing, Zhang Ziyi, Zhang Min. 2021. Text Analysis in the Research of Finance and Accounting: Review and Prospect. Accounting and Economic Research, 35(1): 3-22.

财务与会计领域的文本分析研究:回顾与展望

基金项目: 中国人民大学科学研究基金(中央高校基本科研业务费专项资金)(19XNL007)
详细信息
  • 摘要: 随着大数据技术的日益成熟,以文本为对象的研究正引起学术界的重视,但目前尚处于起步阶段,有必要对文本分析技术和文献进行系统梳理。文章从文本信息来源、文本分析技术、文本特征提取、文本分析应用、国内文本分析研究现状五个维度对财务与会计领域现有文本分析技术和文献进行了详细介绍,并指出未来研究方向,有助于国内学者了解财务与会计领域文本分析研究的特征与进展,引起更多学者对财务与会计领域文本分析研究的重视。

    Text Analysis in the Research of Finance and Accounting: Review and Prospect

  • 图  1  文本分析技术

    图  2  文本特征

    图  3  国内文本分析研究文献年度分布

    表  1  国内文本分析研究文献的期刊分布

    期刊 发文量 期刊 发文量 期刊 发文量
    情报学报 86 中国工业经济 6 财贸经济 4
    科学学与科学技术管理 27 系统管理学报 6 农业经济问题 3
    科学学研究 24 系统工程 6 工业工程与管理 3
    系统工程理论与实践 16 管理评论 6 中国农村经济 2
    科研管理 15 公共管理学报 6 经济研究 2
    会计研究 13 金融研究 5 运筹与管理 1
    管理世界 13 管理工程学报 5 预测 1
    中国软科学 10 数理统计与管理 4 研究与发展管理 1
    中国管理科学 10 审计研究 4 系统工程学报 1
    管理学报 9 南开管理评论 4 世界经济 1
    统计研究 7 经济学动态 4 经济学(季刊) 1
    管理科学学报 7 管理科学 4 经济理论与经济管理 1
      注:未列出期刊的发文量均为0。本次统计对较早年份的文献进行了人工筛选,手动剔除了本文选定的中文期刊中与文本分析无关的文献;在《中国社会科学》《北京大学学报(哲学社会科学版)》《复旦学报(社会科学版)》《心理学报》《中国人民大学学报》五本期刊中,以“文本”为关键词查找到的文献均属于文学领域,与本研究无关,故进行了剔除处理;在《情报学报》中,1989−2002年的文献多为检索系统方面的研究,本文将此类文献排除在外;此外,《研究与发展管理》中有一篇文献与“超文本型组织”相关,《国际贸易问题》中有两篇以“文本”为关键词的文献并非真正意义上的文本分析,《统计研究》中有一篇文献属于统计科学研讨会会议纪要,一篇文献为期刊导读,故亦未将上述文献纳入统计范围。
    下载: 导出CSV
  • [1] 陈霄, 叶德珠, 邓洁. 2018. 借款描述的可读性能够提高网络借款成功率吗. 中国工业经济 (3): 174−192.
    [2] 何贤杰, 王孝钰, 赵海龙, 陈信元. 2016. 上市公司网络新媒体信息披露研究: 基于微博的实证分析. 财经研究 (3): 16−27.
    [3] 林乐, 谢德仁. 2016. 投资者会听话听音吗? —基于管理层语调视角的实证研究. 财经研究 (7): 28−39.
    [4] 马黎珺, 伊志宏, 张澈. 2019. 廉价交谈还是言之有据? —分析师报告文本的信息含量研究. 管理世界 (7): 182−200. doi: 10.3969/j.issn.1002-5502.2019.07.015
    [5] 彭红枫, 林川. 2018. 言之有物: 网络借贷中语言有用吗? —来自人人贷借款描述的经验证据. 金融研究 (11): 133−152.
    [6] 丘心颖, 郑小翠, 邓可斌. 2016. 分析师能有效发挥专业解读信息的作用吗? —基于汉字年报复杂性指标的研究. 经济学(季刊) (4): 1483−1506.
    [7] 饶育蕾, 彭叠峰, 成大超. 2010. 媒体注意力会引起股票的异常收益吗? —来自中国股票市场的经验证据. 系统工程理论与实践 (2): 287−297. doi: 10.12011/1000-6788(2010)2-287
    [8] 任宏达, 王琨. 2018. 社会关系与企业信息披露质量—基于中国上市公司年报的文本分析. 南开管理评论 (5): 128−138. doi: 10.3969/j.issn.1008-3448.2018.05.014
    [9] 孙书娜, 孙谦. 2018. 投资者关注和股市表现—基于雪球关注度的研究. 管理科学学报 (6): 60−71. doi: 10.3969/j.issn.1007-9807.2018.06.005
    [10] 汪昌云, 武佳薇. 2015. 媒体语气、投资者情绪与IPO定价. 金融研究 (9): 174−189.
    [11] 王靖一, 黄益平. 2018. 金融科技媒体情绪的刻画与对网贷市场的影响. 经济学(季刊) (4): 1623−1650.
    [12] 王雄元, 高曦, 何捷. 2018. 年报风险信息披露与审计费用—基于文本余弦相似度视角. 审计研究 (5): 98−104. doi: 10.3969/j.issn.1002-4239.2018.05.014
    [13] 游家兴, 吴静. 2012. 沉默的螺旋: 媒体情绪与资产误定价. 经济研究 (7): 141−152.
    [14] 俞庆进, 张兵. 2012. 投资者有限关注与股票收益—以百度指数作为关注度的一项实证研究. 金融研究 (8): 152−165.
    [15] 曾建光. 2015. 网络安全风险感知与互联网金融的资产定价. 经济研究 (7): 131−145.
    [16] 曾庆生, 周波, 张程, 陈信元. 2018. 年报语调与内部人交易: “表里如一”还是“口是心非”? 管理世界 (9): 143−160. doi: 10.3969/j.issn.1002-5502.2018.09.012
    [17] 朱朝晖, 包燕娜, 许文瀚. 2018. 管理层语调离差策略及其对分析师预测乐观度影响—基于A股制造业上市公司MD&A文本分析. 财经论丛 (2): 39−46.
    [18] Allee, K. D., and M. D. DeAngelis. 2015. The structure of voluntary disclosure narratives: Evidence from tone dispersion. Journal of Accounting Research 53(2): 241−274. doi: 10.1111/1475-679X.12072
    [19] Antweiler, W., and M. Z. Frank. 2004. Is all that talk just noise? The information content of internet stock message boards. The Journal of Finance 59(3): 1259−1294. doi: 10.1111/j.1540-6261.2004.00662.x
    [20] Baker, S. R., N. Bloom, and S. J. Davis. 2016. Measuring economic policy uncertainty. The Quarterly Journal of Economics 131(4): 1593−1636. doi: 10.1093/qje/qjw024
    [21] Baloria, V. P., and J. Heese. 2018. The effects of media slant on firm behavior. Journal of Financial Economics 129(1): 184−202. doi: 10.1016/j.jfineco.2018.04.004
    [22] Bandiera, O., A. Prat, S. Hansen, and R. Sadun. 2020. CEO behavior and firm performance. Journal of Political Economy 128(4): 1325−1369. doi: 10.1086/705331
    [23] Bao, Y., and A. Datta. 2014. Simultaneously discovering and quantifying risk types from textual risk disclosures. Management Science 60(6): 1371−1391. doi: 10.1287/mnsc.2014.1930
    [24] Baumer, E. P., D. Mimno, S. Guha, E. Quan, and G. K. Gay. 2017. Comparing grounded theory and topic modeling: Extreme divergence or unlikely convergence? Journal of the Association for Information Science and Technology 68(6): 1397−1410. doi: 10.1002/asi.23786
    [25] Blaseg, D., and C. E. Bannier. 2019. Summarization in financial disclosures: Determinants and effects of prospectus summaries. SSRN Working Paper.
    [26] Blei, D. M., A. Y. Ng, and M. I. Jordan. 2003. Latent dirichlet allocation. The Journal of Machine Learning Research 3(5): 993−1022.
    [27] Bochkay, K., R. Chychyla, and D. Nanda. 2019. Dynamics of CEO disclosure style. The Accounting Review 94(4): 103−140. doi: 10.2308/accr-52281
    [28] Bochkay, K., J. Hales, and S. Chava. 2020. Hyperbole or reality? Investor response to extreme language in earnings conference calls. The Accounting Review 95(2): 31−60. doi: 10.2308/accr-52507
    [29] Bonaime, A., H. Gulen, and M. Ion. 2018. Does policy uncertainty affect mergers and acquisitions? Journal of Financial Economics 129(3): 531−558. doi: 10.1016/j.jfineco.2018.05.007
    [30] Bonsall, S. B., A. J. Leone, B. P. Miller, and K. Rennekamp. 2017. A plain English measure of financial reporting readability. Journal of Accounting and Economics 63(2−3): 329−357. doi: 10.1016/j.jacceco.2017.03.002
    [31] Brown, N. C., R. M. Crowley, and W. B Elliott. 2020. What are you saying? Using topic to detect financial misreporting. Journal of Accounting Research 58(1): 237−291. doi: 10.1111/1475-679X.12294
    [32] Brown, S. V., and J. W. Tucker. 2011. Large-sample evidence on firms’ year-over-year MD&A modifications. Journal of Accounting Research 49(2): 309−346. doi: 10.1111/j.1475-679X.2010.00396.x
    [33] Buntine, W. L., and A. Jakulin. 2004. Applying discrete PCA in data analysis. HIIT Technical Report.
    [34] Buehlmaier, M. M., and T. M. Whited. 2018. Are financial constraints priced? Evidence from textual analysis. The Review of Financial Studies 31(7): 2693−2728. doi: 10.1093/rfs/hhy007
    [35] Bushee, B. J., I. D. Gow, and D. J. Taylor. 2018. Linguistic complexity in firm disclosures: Obfuscation or information? Journal of Accounting Research 56(1): 85−121. doi: 10.1111/1475-679X.12179
    [36] Campbell, J. L., H. Chen, D. S. Dhaliwal, H. M. Lu, and L. B. Steele. 2014. The information content of mandatory risk factor disclosures in corporate filings. Review of Accounting Studies 19(1): 396−455. doi: 10.1007/s11142-013-9258-3
    [37] Cardinaels, E., S. Hollander, and B. J. White. 2019. Automatic summarization of earnings releases: Attributes and effects on investors’ judgments. Review of Accounting Studies 24(3): 860−890. doi: 10.1007/s11142-019-9488-0
    [38] Chen, H., P. De, Y. J. Hu, and B. H. Hwang. 2014. Wisdom of crowds: The value of stock opinions transmitted through social media. The Review of Financial Studies 27(5): 1367−1403. doi: 10.1093/rfs/hhu001
    [39] Chen, M. A., Q. Wu, and B. Yang. 2019. How valuable is FinTech innovation? The Review of Financial Studies 32(5): 2062−2106. doi: 10.1093/rfs/hhy130
    [40] Chi, S. S., and D. M. Shanthikumar. 2017. Local bias in Google search and the market response around earnings announcements. The Accounting Review 92(4): 115−143. doi: 10.2308/accr-51632
    [41] Chowdhury, G. G. 2003. Natural language processing. Annual Review of Information Science and Technology 37(1): 51−89.
    [42] Collobert, R., J. Weston, L. Bottou, M. Karlen, K. Kavukcuoglu, and P. Kuksa. 2011. Natural language processing (almost) from scratch. Journal of Machine Learning Research 12(1): 2493−2537.
    [43] Cookson, J. A., and M. Niessner. 2020. Why don’t we agree? Evidence from a social network of investors. The Journal of Finance 75(1): 173−228. doi: 10.1111/jofi.12852
    [44] Da, Z., J. Engelberg, and P. Gao. 2011. In search of attention. The Journal of Finance 66(5): 1461−1499. doi: 10.1111/j.1540-6261.2011.01679.x
    [45] Da, Z., J. Engelberg, and P. Gao. 2015. The sum of all FEARS investor sentiment and asset prices. The Review of Financial Studies 28(1): 1−32. doi: 10.1093/rfs/hhu072
    [46] Dale, E., and J. S. Chall. 1949. Techniques for selecting and writing readable materials. Elementary English 26(5): 250−258.
    [47] Das, S. R., and M. Y. Chen. 2007. Yahoo! for Amazon: Sentiment extraction from small talk on the web. Management Science 53(9): 1375−1388. doi: 10.1287/mnsc.1070.0704
    [48] Davis, A. K., W. Ge, D. Matsumoto, and J. L. Zhang. 2015. The effect of manager-specific optimism on the tone of earnings conference calls. Review of Accounting Studies 20(2): 639−673. doi: 10.1007/s11142-014-9309-4
    [49] De Franco, G., O. K. Hope, D. Vyas, and Y. Zhou. 2015. Analyst report readability. Contemporary Accounting Research 32(1): 76−104. doi: 10.1111/1911-3846.12062
    [50] Feldman, R., S. Govindaraj, J. Livnat, and B. Segal. 2010. Management’s tone change, post earnings announcement drift and accruals. Review of Accounting Studies 15(4): 915−953. doi: 10.1007/s11142-009-9111-x
    [51] Flesch, R. 1948. A new readability yardstick. Journal of Applied Psychology 32(3): 221. doi: 10.1037/h0057532
    [52] Frankel, R., J. Jennings, and J. Lee. 2016. Using unstructured and qualitative disclosures to explain accruals. Journal of Accounting and Economics 62(2−3): 209−227. doi: 10.1016/j.jacceco.2016.07.003
    [53] Frank, M. Z., and A. Sanati. 2018. How does the stock market absorb shocks? Journal of Financial Economics 129(1): 136−153. doi: 10.1016/j.jfineco.2018.04.002
    [54] Garcia, D. 2013. Sentiment during recessions. The Journal of Finance 68(3): 1267−1300. doi: 10.1111/jofi.12027
    [55] Green, T. C., R. Huang, Q. Wen, and D. Zhou. 2019. Crowdsourced employer reviews and stock returns. Journal of Financial Economics 134(1): 236−251. doi: 10.1016/j.jfineco.2019.03.012
    [56] Guay, W., D. Samuels, and D. Taylor. 2016. Guiding through the fog: Financial statement complexity and voluntary disclosure. Journal of Accounting and Economics 62(2-3): 234−269. doi: 10.1016/j.jacceco.2016.09.001
    [57] Gulen, H., and M. Ion. 2016. Policy uncertainty and corporate investment. The Review of Financial Studies 29(3): 523−564.
    [58] Gurun, U. G., and A. W. Butler. 2012. Don’t believe the hype: Local media slant, local advertising, and firm value. Journal of Finance 67(2): 561−598. doi: 10.1111/j.1540-6261.2012.01725.x
    [59] Gunning, R.1952. Technique of clear writing. New York: McGraw-Hill.
    [60] Hanley, K. W., and G. Hoberg. 2019. Dynamic interpretation of emerging risks in the financial sector. The Review of Financial Studies 32(12): 4543−4603. doi: 10.1093/rfs/hhz023
    [61] Hernandez-Castaneda, A., R. A. Garcia-Hernandez, Y. Ledeneva, and C. E. Millan-Hernandez. 2020. Extractive automatic text summarization based on lexical-semantic keywords. IEEE Access 8: 49896−49907. doi: 10.1109/ACCESS.2020.2980226
    [62] Hillert, A., H. Jacobs, and S. Müller. 2014. Media makes momentum. The Review of Financial Studies 27(12): 3467−3501. doi: 10.1093/rfs/hhu061
    [63] Hoberg, G., and G. Phillips. 2010. Product market synergies and competition in mergers and acquisitions: A text-based analysis. The Review of Financial Studies 23(10): 3773−3811. doi: 10.1093/rfs/hhq053
    [64] Hoberg, G., and G. Phillips. 2016. Text-based network industries and endogenous product differentiation. Journal of Political Economy 124(5): 1423−1465. doi: 10.1086/688176
    [65] Huang, A. H., A. Y. Zang, and R. Zheng. 2014. Evidence on the information content of text in analyst reports. The Accounting Review 89(6): 2151−2180. doi: 10.2308/accr-50833
    [66] Huang, J. 2018. The customer knows best: The investment value of consumer opinions. Journal of Financial Economics 128(1): 164−182. doi: 10.1016/j.jfineco.2018.02.001
    [67] Huang, Y., and P. Luk. 2020. Measuring economic policy uncertainty in China. China Economic Review 59, 101367.
    [68] Huang, Y., H. Qiu, and Z. Wu. 2016. Local bias in investor attention: Evidence from China’s internet stock message boards. Journal of Empirical Finance 38: 338−354. doi: 10.1016/j.jempfin.2016.07.007
    [69] Hwang, B. H., and H. H. Kim. 2017. It pays to write well. Journal of Financial Economics 124(2): 373−394. doi: 10.1016/j.jfineco.2017.01.006
    [70] Janasik, N., T. Honkela, and H. Bruun. 2009. Text mining in qualitative research: Application of an unsupervised learning method. Organizational Research Methods 12(3): 436−460. doi: 10.1177/1094428108317202
    [71] Jegadeesh, N., and D. Wu. 2013. Word power: A new approach for content analysis. Journal of Financial Economics 110(3): 712−729. doi: 10.1016/j.jfineco.2013.08.018
    [72] Jiang, F., J. Lee, X. Martin, and G. Zhou. 2019a. Manager sentiment and stock returns. Journal of Financial Economics 132(1): 126−149. doi: 10.1016/j.jfineco.2018.10.001
    [73] Jiang, L., J. Liu, and B. Yang. 2019b. Communication and comovement: Evidence from online stock forums. Financial Management 48(3): 805−847. doi: 10.1111/fima.12245
    [74] Jones, M. J., and P. A. Shoemaker. 1994. Accounting narratives: A review of empirical studies of content and readability. Journal of Accounting Literature 13(1): 142.
    [75] Joshi, K. 1991. A model of users’ perspective on change: The case of information systems technology implementation. Mis Quarterly 15(2): 229−242. doi: 10.2307/249384
    [76] Jung, M. J., J. P. Naughton, A. Tahoun, and C. Wang. 2018. Do firms strategically disseminate? Evidence from corporate use of social media. The Accounting Review 93(4): 225−252. doi: 10.2308/accr-51906
    [77] Kelly, B., D. Papanikolaou, A. Seru, and M. Taddy. 2018. Measuring technological innovation over the long run. NBER Working Paper.
    [78] Kogan, S., T. J. Moskowitz, and M. Niessner. 2018. Fake news: Evidence from financial markets. SSRN Working Paper.
    [79] Kouloumpis, E., T. Wilson, and J. Moore. 2011. Twitter sentiment analysis: The good the bad and the OMG! International Conference on Weblogs & Social Media.
    [80] Lang, M., and L. Stice-Lawrence. 2015. Textual analysis and international financial reporting: Large sample evidence. Journal of Accounting and Economics 60(2-3): 110−135. doi: 10.1016/j.jacceco.2015.09.002
    [81] Larcker, D. F., and A. A. Zakolyukina. 2012. Detecting deceptive discussions in conference calls. Journal of Accounting Research 50(2): 495−540. doi: 10.1111/j.1475-679X.2012.00450.x
    [82] Lawrence, A. 2013. Individual investors and financial disclosure. Journal of Accounting and Economics 56(1): 130−147. doi: 10.1016/j.jacceco.2013.05.001
    [83] Lehavy, R., F. Li, and K. Merkley. 2011. The effect of annual report readability on analyst following and the properties of their earnings forecasts. The Accounting Review 86(3): 1087−1115. doi: 10.2308/accr.00000043
    [84] Lewis, N. R., L. D. Parker, G. D. Pound, and P. Sutcliffe. 1986. Accounting report readability: The use of readability techniques. Accounting and Business Research 16(63): 199−213. doi: 10.1080/00014788.1986.9729318
    [85] Li, F. 2008. Annual report readability, current earnings, and earnings persistence. Journal of Accounting and Economics 45(2-3): 221−247. doi: 10.1016/j.jacceco.2008.02.003
    [86] Li, F. 2010. The information content of forward-looking statements in corporate filings—A naïve Bayesian machine learning approach. Journal of Accounting Research 48(5): 1049−1102. doi: 10.1111/j.1475-679X.2010.00382.x
    [87] Lo, K., F. Ramos, and R. Rogo. 2017. Earnings management and annual report readability. Journal of Accounting and Economics 63(1): 1−25. doi: 10.1016/j.jacceco.2016.09.002
    [88] Loughran, T., and B. McDonald. 2011. When is a liability not a liability? Textual analysis, dictionaries, and 10-Ks. The Journal of Finance 66(1): 35−65. doi: 10.1111/j.1540-6261.2010.01625.x
    [89] Loughran, T., and B. McDonald. 2014. Measuring readability in financial disclosures. The Journal of Finance 69(4): 1643−1671. doi: 10.1111/jofi.12162
    [90] Loughran, T., and B. McDonald. 2016. Textual analysis in accounting and finance: A survey. Journal of Accounting Research 54(4): 1187−1230. doi: 10.1111/1475-679X.12123
    [91] Loughran, T., B. McDonald, and H. Yun. 2009. A wolf in sheep’s clothing: The use of ethics-related terms in 10-K reports. Journal of Business Ethics 89(1): 39−49.
    [92] Manela, A., and A. Moreira. 2017. News implied volatility and disaster concerns. Journal of Financial Economics 123(1): 137−162. doi: 10.1016/j.jfineco.2016.01.032
    [93] Mayew, W. J., M. Sethuraman, and M. Venkatachalam. 2015. MD&A disclosure and the firm’s ability to continue as a going concern. The Accounting Review 90(4): 1621−1651. doi: 10.2308/accr-50983
    [94] Mckenny, A. F., H. Aguinis, and A. H. Anglin. 2016. What doesn’t get measured does exist improving the accuracy of computer-aided text analysis. Journal of Management 44(7): 2909−2933.
    [95] Mc Laughlin, G. H. 1969. SMOG grading—a new readability formula. Journal of Reading 12(8): 639−646.
    [96] Piotroski, J. D., T. J. Wong, and T. Zhang. 2017. Political bias in corporate news: The role of conglomeration reform in China. The Journal of Law and Economics 60(1): 173−207. doi: 10.1086/693096
    [97] Price, S. M., J. S. Doran, D. R. Peterson, and B. A. Bliss. 2012. Earnings conference calls and stock returns: The incremental informativeness of textual tone. Journal of Banking & Finance 36(4): 992−1011.
    [98] Reinard, J. C. 2008. Introduction to communication research. Corporate Communications: An International Journal 4(4): 208−209.
    [99] Renault, T. 2017. Intraday online investor sentiment and return patterns in the US stock market. Journal of Banking & Finance 84: 25−40.
    [100] Ryans, J. P. 2021. Textual classification of SEC comment letters. Review of Accounting Studies 26(1): 37−80.
    [101] Schütze, H., C. D. Manning, and P. Raghavan. 2008. Introduction to information retrieval. Cambridge: Cambridge University Press.
    [102] Short, J. C., J. C. Broberg, C. C. Cogliser, and K. H. Brigham. 2010. Construct validation using computer-aided text analysis (CATA): An illustration using entrepreneurial orientation. Organizational Research Methods 13(2): 320−347. doi: 10.1177/1094428109335949
    [103] Solomon, D. H., E. Soltes, and D. Sosyura. 2014. Winners in the spotlight: Media coverage of fund holdings as a driver of flows. Journal of Financial Economics 113(1): 53−72. doi: 10.1016/j.jfineco.2014.02.009
    [104] Strauss, A., and J. Corbin. 1998. Basics of qualitative research: Techniques and procedures for developing grounded theory. Working Paper.
    [105] Tetlock, P. C. 2007. Giving content to investor sentiment: The role of media in the stock market. The Journal of Finance 62(3): 1139−1168. doi: 10.1111/j.1540-6261.2007.01232.x
    [106] Tetlock, P. C., M. Saar-Tsechansky, and S. Macskassy. 2008. More than words: Quantifying language to measure firms’ fundamentals. The Journal of Finance 63(3): 1437−1467. doi: 10.1111/j.1540-6261.2008.01362.x
    [107] Thomas, G., R. D. Hartley, and J. P. Kincaid. 1975. Test-retest and inter-analyst reliability of the automated readability index, flesch reading ease score, and the fog count. Journal of Literacy Research 7(2): 149−154.
    [108] Yan, Y., X. Xiong, J. G. Meng, and G. Zou. 2019. Uncertainty and IPO initial returns: Evidence from the tone analysis of China’s IPO prospectuses. Pacific-Basin Finance Journal 57, 101075.
    [109] You, H., and X. Zhang. 2009. Financial reporting complexity and investor underreaction to 10-K information. Review of Accounting Studies 14(4): 559−586. doi: 10.1007/s11142-008-9083-2
    [110] You, J., B. Zhang, and L. Zhang. 2018. Who captures the power of the pen? The Review of Financial Studies 31(1): 43−96. doi: 10.1093/rfs/hhx055
图(3) / 表(1)
计量
  • 文章访问数:  613
  • HTML全文浏览量:  897
  • PDF下载量:  519
  • 被引次数: 0
出版历程
  • 收稿日期:  2020-10-18
  • 刊出日期:  2021-01-25

目录

    财务与会计领域的文本分析研究:回顾与展望

      基金项目:  中国人民大学科学研究基金(中央高校基本科研业务费专项资金)(19XNL007)
      作者简介:

      刘云菁,中国人民大学商学院博士研究生,liuyunjing1998@ruc.edu.cn

      张紫怡,中国人民大学商学院本科生,2017201331@ruc.edu.cn

      通讯作者: 张敏(通讯作者),博士,中国人民大学商学院教授, zhangminzip@163.com
    • 中图分类号: F23

    摘要: 随着大数据技术的日益成熟,以文本为对象的研究正引起学术界的重视,但目前尚处于起步阶段,有必要对文本分析技术和文献进行系统梳理。文章从文本信息来源、文本分析技术、文本特征提取、文本分析应用、国内文本分析研究现状五个维度对财务与会计领域现有文本分析技术和文献进行了详细介绍,并指出未来研究方向,有助于国内学者了解财务与会计领域文本分析研究的特征与进展,引起更多学者对财务与会计领域文本分析研究的重视。

    English Abstract

    刘云菁, 张紫怡, 张敏. 2021. 财务与会计领域的文本分析研究:回顾与展望. 会计与经济研究, 35(1): 3-22.
    引用本文: 刘云菁, 张紫怡, 张敏. 2021. 财务与会计领域的文本分析研究:回顾与展望. 会计与经济研究, 35(1): 3-22.
    Liu Yunjing, Zhang Ziyi, Zhang Min. 2021. Text Analysis in the Research of Finance and Accounting: Review and Prospect. Accounting and Economic Research, 35(1): 3-22.
    Citation: Liu Yunjing, Zhang Ziyi, Zhang Min. 2021. Text Analysis in the Research of Finance and Accounting: Review and Prospect. Accounting and Economic Research, 35(1): 3-22.
      • 数字经济浪潮下,不仅社会生产的方方面面受到影响,人类的数据总量也在不断增加。非结构化数据占据了人类数据总量的绝大部分,而且比重不断上升。作为非结构化数据的重要组成部分,文本数据的类型丰富多样(如社交网络类文本、上市公司披露类文本、媒体报道类文本等),在财务与会计领域具有较高的研究价值,因而文本分析(Textual Analysis)技术异军突起,形成一个新的研究领域。所谓文本分析,是指以文本数据为信息来源,运用特定的技术挖掘文本的情绪、可读性、相似度等特征,并利用这些特征进行实证研究的技术。早期的文本分析技术不成熟,人工编码的研究方法也不适用于大样本研究。因此,传统的财务与会计研究在相当长时间内,仍主要局限于利用结构化数据进行研究,文本分析研究并不多见。

        随着计算机处理技术的发展,文本分析技术日新月异,为文本信息的结构化处理提供了新方法与新工具,极大地拓展了研究视角(Blei等,2003Schütze等,2008Kouloumpis等,2011Loughran和McDonald,2011)。运用主题分析、词典法、词袋法、监督学习、无监督学习、自然语言处理等文本分析技术,通过对社交网络类文本、上市公司披露类文本、媒体报道类文本以及其他类文本信息进行挖掘,研究者能够提取文本的情绪(Tetlock,2007Loughran等,2009林乐和谢德仁,2016)、可读性(Lehavy等,2011Guay等,2016)、相似度(Hoberg和Phillips,2010Lang和Stice-Lawrence,2015)、摘要(Blaseg和Bannier,2019Cardinaels等,2019)、主题(Bao和Datta,2014Hanley和Hoberg,2019)、分类(Frankel等,2016Bandiera等,2020)以及数量(Da等,2011俞庆进和张兵,2012)等特征,并进一步展开研究,为财务与会计领域提供了更丰富的研究视角与内容。

        与国内相比,国际上对文本分析的研究起步较早,成果也较为丰富。Antweiler和Frank(2004)首次使用网络信息平台预测股票市场,发现股吧留言能够预测股票交易量和波动性。Li(2008)开创性地利用大样本研究年报可读性,发现管理层可能会策略性地管理文本可读性。Li(2010)首次采用机器学习算法研究财务报告披露,聚焦公司年报“管理层讨论与分析”(MD&A)中前瞻性声明的信息内容。Loughran和McDonald(2011)创建了金融学领域专属的情绪词典。Campbell等(2014)开创性地将LDA模型应用于风险披露研究,从风险披露文本中提取风险因素。Huang等(2014)则首次在大样本下探究分析师报告的文本内容。

        总体而言,现有文献着重于改进文本分析的技术或直接将文本分析应用于财务与会计领域的研究,但缺乏对文本分析研究方法与应用的详细系统的介绍。本文主要从以下方面对现有文本分析研究进行梳理和总结:第一,根据不同的文本信息种类分别对国内外文本分析研究进行梳理,有助于研究者了解文本信息的来源与获取方式;第二,详细介绍各种文本分析处理技术,包括主题分析、词典法、词袋法、监督学习、无监督学习以及自然语言处理,有助于研究者熟悉文本分析处理技术;第三,归纳文本分析研究通常提取的文本特征,有助于研究者把握文本分析在财务与会计领域相关研究中的主要关注点;第四,总结文本分析研究的主要应用类型,有助于研究者了解文本分析研究的应用主题与视角;第五,回顾国内文本分析论文发表情况,有助于研究者把握国内文本分析研究进展。

      • 本部分从文本信息来源的角度,对文本分析研究进行回顾。现有研究中常用的文本信息来源主要包括社交网络类文本、上市公司披露类文本(如年报、季报、电话会议文本、盈余公告、日志文本、招股说明书等)、媒体报道类文本以及其他类文本。

      • 随着近年来社交网络的兴起,大量社交网络的文本信息被纳入文本分析研究范畴,微博、股吧、Twitter等社交媒体与网络平台的文本信息逐渐成为研究的重点。

        基于国外社交网络的文本数据已有大量研究,大多数研究发现社交网络文本信息能预测股票价格波动与公司未来收益。Antweiler和Frank(2004)以雅虎财经网络论坛留言板上关于45家公司的150万条信息为样本,发现股票留言板的信息包含与股票定价相关的信息。Chen等(2014)Huang(2018)Green等(2019)分别着眼于Seeking Alpha上投资者的观点、亚马逊的客户产品评论与Glassdoor上员工对雇主的评级信息,得到同样结论。Jung等(2018)分析标准普尔1500公司使用Twitter发布季度收益公告的情况,探究公司是否使用社交媒体策略性地传播财务信息。也有不少学者基于社交网络文本数据研究投资者情绪。如Das和Chen(2007)利用摩根士丹利高科技股指数(MSH)中24只科技股公告板上的所有信息,构建了投资者情绪指标。Renault(2017)Cookson和Niessner(2020)利用StockTwits上的用户信息,分析投资者情绪并研究投资者分歧的来源。

        国内社交网络平台的文本数据也日益受到关注。何贤杰等(2016)手工收集上市公司在新浪微博上发布的信息,发现治理水平越高的公司越倾向于开设微博,且发布更多与公司密切相关的信息。Huang等(2016)利用东方财富网股吧数据,考察投资者关注的地域偏差。孙书娜和孙谦(2018)基于雪球社区用户的自选股信息构建了日度超额雪球关注度指标,发现该指标能更真实、直接、准确地反映个人投资者的关注水平。Jiang等(2019b)同样选取东方财富网股吧数据,探究投资者沟通对上市公司资产波动的影响。

      • 对上市公司披露的文本信息的分析,能够弥补财务数据的不足,从而挖掘出更丰富的信息。其中,针对年报、季报、电话会议文本、盈余公告、日志文本以及招股说明书的研究比较广泛。

        国外上市公司披露的文本信息较早受到关注。Li(2008)首次在大样本下聚焦年报,研究年报可读性和其他词汇特征。许多学者以10-K、10-Q文件为研究对象,考察产品描述部分(Hoberg和Phillips,2010Hoberg和Phillips,2016)、MD&A中的前瞻性陈述(Li,2010Mayew等,2015Frankel等,2016)、文本可读性(Lehavy等,2011Lo等,2017)、风险因素披露部分(Bao和Datta,2014Campbell等,2014Hanley和Hoberg,2019)、财报复杂性(Guay等,2016)、文本语调(Loughran和McDonald,2011)、融资约束(Buehlmaier和Whited,2018)以及文本主题(Brown等,2020)等方面内容。也有很多研究聚焦管理层电话会议,探究CEO和CFO的语言特征(Larcker和Zakolyukina,2012Davis等,2015Bochkay等,2019Jiang等,2019a)、语调分散度(Allee和DeAngelis,2015)、语言复杂性(Bushee等,2018)、极端语言(Bochkay等,2020)等方面内容。还有不少文献选取股东报告、CEO日志文本、盈余公告等作为文本来源展开研究(Hwang和Kim,2017Cardinaels等,2019Bandiera等,2020)。

        国内关于上市公司披露类文本方面的研究相对较少。丘心颖等(2016)针对上市公司年报构造复杂性与可读性指标,分析了其与分析师跟踪、预测质量之间的关系。林乐和谢德仁(2016)基于中国上市公司2005−2012年年度业绩说明会文本的管理层语调数据,利用文本分析方法实证检验中国投资者是否会听话听音。王雄元等(2018)基于2007−2016年上市公司年报MD&A中与风险有关的信息,从文本相似度视角研究年报风险信息披露与审计费用的关系。曾庆生等(2018)基于中国A股非金融公司2007−2014年年报语调进行文本分析,探究年报语调与年报披露后的内部人交易行为之间的关系。You等(2018)Yan等(2019)着眼于2007−2016年中国A股市场1320份IPO招股说明书,探究招股说明书的负面基调、不确定性与投资者对IPO公司的初评估以及IPO后股票收益率、股价波动率的关系。

      • 国外媒体报道类文本研究相当丰富,为政策不确定性与媒体的经济后果提供了经验证据。Baker等(2016)基于美国10家主要报纸构建了月度经济政策不确定性指数。Gulen和Ion(2016)选取1987年1月至2013年12月的新闻计算政策不确定性指数,并探讨其与公司资本投资之间的关系。Manela和Moreira(2017)选取《华尔街日报》1889−2009年的头版文章作为数据集,构建基于文本的指标以度量人们对不确定性的感知。Bonaime等(2018)探讨了经济政策不确定性对企业并购的影响。除用于构造政策不确定指数,媒体报道类文本还能用来分析媒体情绪。Gurun和Butler(2012)收集本地报纸发布的公司特定新闻,考察本地媒体在报道本地与非本地公司新闻时,负面词汇的使用是否存在差异。Frank和Sanati(2018)聚焦《金融时报》(Financial Times)1982年4月1日至2013年9月30日的新闻报道,发现市场对新信息(积极与消极)的反应存在明显差异。Baloria和Heese(2018)统计了与企业相关的负面新闻的数量变化,发现企业可通过预期行动来管理声誉资本。Hillert等(2014)根据1989−2010年45家美国国家和地方报纸的220万篇文章,探索媒体报道与投资者偏见之间的关系。Allee和DeAngelis(2015)收集与上市公司并购谣言相关的首份新闻报道,研究了媒体准确性的影响因素及其对资产价格的影响。Kogan等(2018)则聚焦金融市场的不实新闻,探究其对股票市场的影响。

        中国证监会规定上市公司必须在“七报一刊”公布相关信息,同时中国还拥有百度新闻、和讯网等网络新闻媒体,媒体报道类文本信息丰富。饶育蕾等(2010)收集2000−2007年中国上市公司在新华网、人民网等77家网络媒体的新闻报道,基于新闻条数构建了媒体注意力指数。游家兴和吴静(2012)选取目前在中国具有广泛影响力、知名度和权威性较高的8家全国性财经报纸,从报道基调、曝光程度、关注水平三个维度构建了衡量媒体情绪指数的综合评价指标体系。汪昌云和武佳薇(2015)基于《中国证券报》《上海证券报》《证券日报》和《证券时报》四大财经媒体以及《金融时报》《证券市场周刊》两大专业金融媒体,构建媒体语气指标以度量公司层面投资者情绪。Piotroski等(2017)选取2000−2010年177万篇关于中国上市公司的国内报纸文章,研究发现官方报纸与非官方报纸目标不同。王靖一和黄益平(2018)基于和讯网1700余万条新闻文本数据,构建了2013年1月至2017年9月的金融科技情绪指数。Huang和Luk(2020)以十份中国报纸为研究对象,构建了2000−2018年中国经济政策不确定性月度指数。

      • 除上述几类来源,文本信息还有网络搜索数据、分析师报告、年度问询函、专利文本、P2P网络借贷文本等其他类型的来源。

        国外其他类文本分析研究的文本来源主要包括网络搜索数据、分析师报告、年度问询函与专利文本。通过谷歌搜索的文本数据信息可以有效衡量不同股票、不同地区、不同关键词的谷歌搜索指数,进而反映投资者关注度并预测股价(Da等,2011Da等,2015Chi和Shanthikumar,2017)。Huang等(2014)De Franco等(2015)则聚焦分析师报告,分别研究分析师报告的语调与可读性。Ryans(2021)将年度问询函进行分类,探讨其与财务报告质量的关系。另有不少学者关注专利文本数据,使用机器学习方法对创新进行分类并计算相似度(Kelly等,2018Chen等,2019)。

        国内其他类文本分析研究的文本来源主要包括网络搜索数据、P2P网络借贷文本与分析师报告。俞庆进和张兵(2012)曾建光(2015)基于百度搜索指数构建投资者关注度指标与投资者网络安全风险感知指标。而随着2007年以来国内P2P网络借贷的兴起,不少学者针对P2P网络借贷文本展开研究,内容主要包括P2P网络借贷成功率、借款利率、筹资效率等(陈霄等,2018彭红枫和林川,2018)。马黎珺等(2019)则对2009−2015年中国A股上市公司发布的分析师报告采用支持向量机进行文本分类。

      • 文本分析技术主要包括主题分析、词典法、词袋法、监督学习、无监督学习与自然语言处理,本部分针对不同的文本分析技术分别进行介绍。如图1所示,从主题分析到自然语言处理,文本分析技术的自动化程度逐渐提高。

        图  1  文本分析技术

      • 主题分析(Thematic Analysis)是一种专家方法,需要有经验的人员基于自身经验和理解,对研究数据进行挖掘。主题分析一般与扎根理论方法相结合,基于专家自身经验和对世界的理解产生对数据的见解,从而构建新理论(Baumer等,2017)。主题分析是一个反复迭代的过程,在分析开始前研究人员尚不知道文本所属类别,需要对文献和数据不断进行比较,通常从参与者自己的语言开始(一阶编码),将相似编码归为一类(二阶编码),从而开发出一系列源自文本的编码和类别(Strauss和Corbin,1998)。主题分析常见于社会学与管理学领域,NVivo、ATLAS.ti等计算机软件能够简化相关过程,但文本分类仍主要依赖人类编码,计算机自动化程度较低。

        主题分析的优点在于使用参与者自身的认知来挖掘数据,对少量文本的理解更为深入。局限性在于其属于时间、劳动力密集型任务,不适合大规模样本,同时由于编码人员的经历和偏好不同,编码标准不统一。

      • 词典法(Dictionary Analysis)是一种运用词典对特定文本的词语(或词组)的词频统计计数,将定性的文本数据压缩成定量的词组频数的文本分析技术(Reinard,2008Short等,2010Mckenny等,2016)。运用词典法的关键是具备成熟且适合所研究领域的词典,否则需要研究者根据研究问题与文本数据,结合领域的相关专业知识构建适配的词典并加以验证。国外已先后形成多部比较成熟的英文文本词典,如Henry词典(Henry Word Lists)、LM词典(Loughran and McDonald Word Lists)、哈佛大学通用调查词典(Harvard General Inquirer Word Lists)、文辞乐观与悲观词典(Diction Optimism and Pessimism Word Lists)等。国内大多数学者在参考英文词典及其他词库的基础上,针对中文文本构建自己的词典并展开研究,如台湾大学NTUSD简体中文情感词典、知网Hownet情感词典、清华大学李军中文褒贬义词典等。一旦拥有适配的词典,则可以采用计算机软件(如LIWC、DICTION、Nvivo、ATLAS.ti、Python等)协助文本内容分析,计算机自动化程度较高,人工工作量较低。词典法通常被用于管理学领域,如计算分析文本的语调情感等。

        与主题分析相比,词典法的优点在于能够对所研究的文本信息进行定量分析,既提高了文本处理的效率,也加深了读者对文本含义或性质的理解与把握,同时还增强了研究的可复制性。词典法的局限性在于针对特定文本构建词典时,需要相关领域的专业知识,因而可能导致构建的特定词典与其他文本适配度不高。另外,词典法会忽略文档的上下文关系。

      • 词袋法(Bag-of-Words)建立在文字词组语序不重要的假设之上,是一种将文本看作是若干词语的集合,只计算每个词语出现次数的文本向量化的表示方法,可将非结构化的定性文本数据转换成计算机能理解和直接使用的向量。词袋法是计算科学领域对文本数据的简化和压缩方法,后续可以据此进行进一步监督学习和无监督学习,常被用于管理学领域,如计算分析文本相似度等。词袋法同样可以采用计算机软件(如软件Python中的scikit-learn、gensim、nltk或软件R中的topicmodels、stm等)协助文本内容分析,计算机自动化程度较高,人工工作量较低。

        词袋法主要包括独热表示法(One-Hot Representation)和词频−逆文档频率法(Term Frequency-Inverse Document Frequency,TF-IDF)。独热表示法将多个文档组织成一个文档特征矩阵,矩阵中每行代表一个文档,每列代表一个特征词,每个元素衡量每个文档中对应特征词的出现频数。词频−逆文档频率法的主要思想:如果某个词或短语在一篇文章中出现的频率高,但在其他文章中很少出现,则认为该词或短语具有很好的类别区分能力,适合用来分类。TF-IDF等于TF×IDF,TF为词频,指某一给定词语在文档中出现的频率;IDF为逆向文档频率,某一特定词语的IDF可以由包含该词语的文档数占总文档数的比例取对数得到。

        词袋法的编码过程忽略了词语先后顺序,因而无法反映上下文含义,牺牲了文本的很多信息,变通性弱,文本分析深度不足;当文档中词语数量过多时,向量维度过高则可能产生维度“灾难”。词袋法的优点在于编码标准稳定统一,具有统计学特性与强扩展性。

      • 监督学习(Supervised Learning)是指将输入数据x和对应标签y作为训练集,以建立合适的模型来学习两者之间的关系,并使用确定的模型来预测未知样本。监督学习中预设的标签可以明确分类目标,而算法则可映射输入与输出之间的联系(Janasik等,2009)。监督学习常被用于计算机科学、政治学与管理学领域,可采用软件Python中的scikit-learn、gensim、nltk或软件R中的topicmodels、stm等实现。衡量监督学习模型预测效果可采用以下评价指标:准确率、查准率、查全率、F得分、AUC等。监督学习算法包括支持向量机、线性回归、逻辑回归、朴素贝叶斯、线性判别分析、决策树、K-近邻等。其中,朴素贝叶斯和支持向量机技术是文本分析中常用的监督学习算法(Schütze等,2008)。

        朴素贝叶斯是一种基于贝叶斯理论的监督机器学习算法,其基本原理如下:根据贝叶斯条件概率公式计算已知文档属于不同文档类别的条件概率,并将该文档归为具有最大后验概率的文档类别。朴素贝叶斯的优点在于算法较为稳定,缺点为数据集的属性之间往往存在相互关联,导致数据之间的独立性要求无法得到满足,进而影响分类效果。

        支持向量机建立在统计学习理论和结构风险最小原理等基础理论之上。支持向量机的目标是最大化分类间隔,基本思想是求解能够正确划分训练数据集且几何间隔最大的分离超平面。支持向量机不仅能解决非线性分类问题,还能有效避免维度“灾难”的发生,在解决小样本、非线性及高维模式识别中表现出诸多特有优势。支持向量机的局限为分类结果对核函数的选择较为敏感。

        监督学习的优点是允许研究者事先定义编码规则,逻辑简单,目标明确,同时可用于海量数据的研究,精确度较高。局限性在于,不仅需要有高质量的标签变量,且训练的模型由于特征词太多容易导致过拟合。

      • 无监督学习(Unsupervised Learning)是指根据类别未知(没有被标记)的训练样本解决模式识别中的各种问题。与监督学习相比,无监督学习不需要为数据打标签,缺乏具有明确目的的训练方式,无法提前预知结果,也很难量化预测效果。无监督学习常被用于计算机科学、政治学与管理学领域,可采用软件Python中的scikit-learn、gensim、nltk或软件R中的topicmodels、stm等实现。聚类和降维技术是文本分析中常用的无监督学习算法。

        聚类的关键是计算相似度,目的在于将相似的东西聚在一起,具体又可分为划分和层次两种方法。划分聚类通过优化评价函数将数据集分割为K个部分,需要K作为输入参数,如K-means算法、K-medoids算法、CLARANS算法等。层次聚类由不同层次的分割聚类组成,层次之间的分割具有嵌套关系,不需要输入参数,但是终止条件必须具体指定,如BIRCH算法、DBSCAN算法、CURE算法等。

        常用的文本降维方法是隐含狄利克雷分布(Latent Dirichlet Allocation,LDA)主题模型(Blei等,2003)。LDA是一种文档主题生成模型,包含词、主题和文档三层结构,可以用来识别大规模文档集或语料库中潜藏的主题信息。LDA认为一篇文章的每个词都是通过“以一定概率选择了某个主题,并从这个主题中以一定概率选择某个词语”这样一个过程得到。LDA模型的优势在于不需要研究者为划分类别预先指定相应的规则和关键词,文本主题分类精确;局限性在于预设主题个数仍具有主观性。

        无监督学习能加速数据的标注与分类,降低人工工作量。缺点为“标注”是机器按照数字特征进行的分组,需要研究者解读才可以赋予“标注”的意义,同时训练过程需要大量的调参。

      • 自然语言处理(Natural Language Processing,NLP)是文本分析技术中自动化程度最高的类型。NLP以语言为对象,利用计算机技术模拟人类如何理解和处理语言,包括自然语言理解和自然语言生成,关注计算机和人类语言相互作用的领域(Joshi,1991Chowdhury,2003Schütze等,2008Collobert等,2011)。NLP考虑单词或文字的先后顺序,可以标记句子中单词的词性(如名词、形容词等),将文档从一种语言翻译成另一种语言,甚至能使用句子的上下文来阐明词语的词义(Buntine和Jakulin,2004)。NLP是一个完全计算机自动化的过程,不需要人类的理解或解释,具有丰富的用途,如采用深度学习和多模式等尖端技术进行情感分析(Kouloumpis等,2011)。NLP在计算机科学、信息科学、语言学、心理学等多个领域被用作文本分析工具(Chowdhury,2003),可采用软件Python中的nltk实现。

        NLP主要有词嵌入(Word Embedding)、长短期记忆网络(Long Short-Term Memory)、深度自注意力网络(Transformer)、基于语义理解的深度双向与训练模型(Bidirectional Encoder Representation from Transformers,BERT)等算法。NLP的优点在于计算机自动化程度高,系统性强,能够分析语义,且执行速度快;局限性在于,大多数模型是个黑箱,可理解性差,模型训练比较耗时。

      • 目前,在财务与会计研究中,已有文献主要提取的文本特征包括如下七个维度:文本情绪、文本可读性、文本相似度、文本摘要、文本主题、文本分类以及文本数量,如图2所示。

        图  2  文本特征

      • 文本情绪分析是指对包含作者的观点、喜好、情感等的主观性文本进行检测、分析和挖掘。文本情绪(或语调)分析主要采用词典法和监督学习法。

        运用词典法进行文本情绪分析时,除选择准确的词典,还需要选择合适的加权方法(Jegadeesh和Wu,2013)。多数学者使用简单比例加总权重法衡量文本情绪,公式如下:Tone=(Pos−Neg)/(Pos+Neg)。

        式中,Pos、Neg分别表示积极、消极词数占文本总词数的比例,Tone为净正面语调指标,Tone越大表明语调越积极。已有研究采用词典法衡量媒体报道情绪(Tetlock,2007Tetlock等,2008游家兴和吴静,2012Garcia,2013Solomon等,2014汪昌云和武佳薇,2015Baloria和Heese,2018Frank和Sanati,2018)、电话会议语气语调(Larcker和Zakolyukina,2012Price等,2012Allee和DeAngelis,2015Davis等,2015Frankel等,2016林乐和谢德仁,2016王靖一和黄益平,2018朱朝晖等,2018Jiang等,2019aBochkay等,2020)、年报语气语调(Loughran等,2009Feldman等,2010Loughran和McDonld,2011Mayew等,2015曾庆生等,2018Jiang等,2019b)、社交网络文本语调(Chen等,2014Renault,2017Cookson和Niessner,2020)以及其他文本语调(彭红枫和林川,2018Cardinaels等,2019)。

        监督学习法也是研究文本情绪的常用方法。许多研究采用朴素贝叶斯进行文本情绪分类(Das和Chen,2007Li,2010Jegadeesh和Wu,2013Huang等,2014),还有研究采用支持向量机进行文本情绪分类(Antweiler和Frank,2004)。

      • 文本可读性是指文本信息能够被读者理解的程度(Dale和Chall,1949Mc Laughlin,1969)。文本可读性高低会影响读者对文本信息的理解,进而对读者的行为与决策产生影响。文本可读性通常采用迷雾指数(Gunning,1952)、Flesch或Flesch-kincaid指数(Flesch,1948Thomas等,1975)、文本长度(You和Zhang,2009)、文本电子档大小(Loughran和McDonald,2014)衡量。早期的文本可读性研究多为小样本研究(Lewis等,1986)。Li(2008)首次在大样本下研究年报可读性,并采用迷雾指数和年报长度度量可读性。后续研究多采用迷雾指数衡量文本可读性(Li,2010Lehavy等,2011Lawrence,2013)。较高的文本可读性可以更好地向投资者传递与公司相关的信息,带来正向的经济后果,如提高分析师盈余预测质量、降低信息不对称程度、提高股票交易量、提升公司价值、提高借款成功率等(Lehavy等,2011De Franco等,2015Frankel等,2016Guay等,2016丘心颖等,2016Hwang和Kim,2017Lo等,2017Bushee等,2018陈霄等,2018)。

        然而采用迷雾指数衡量文本可读性仍然存在如下局限:一方面,在度量商业文本时难以区分公司复杂性与年报可读性(Loughran和McDonald,2016);另一方面,迷雾指数忽略了语言的语序和逻辑关系(Jones和Shoemaker,1994)。之后出现了大量改进的文本可读性衡量指标,包括为捕捉更全面的文本特征而创建的StyleWriter软件包中的Bog指数(Bonsall等,2017)以及采用支持向量机的机器学习算法等(任宏达和王琨,2018)。

      • 文本相似度是从文本信息中提取的重要文本特征之一。度量文本相似度通常有以下三种方法:一是基于关键词匹配的传统方法,如采用N-gram相似度;二是将文本映射到向量空间,计算余弦相似度等指标;三是采用深度学习算法,包括基于用户点击数据的深度学习语义匹配模型DSSM、基于卷积神经网络的ConvNet和Siamese LSTM等。目前使用较多的是采用余弦相似度指标来衡量文本相似度(Hoberg和Phillips,2010Hoberg和Phillips,2016Kelly等,2018王雄元等,2018)。文本相似度的研究角度较多,不仅可以研究不同企业之间披露文本的相似度(Hoberg和Phillips,2010Hoberg和Phillips,2016),还可以研究同一企业不同时期披露文本的相似度(Brown和Tucker,2011Lang和Stice-Lawrence,2015)。

      • 文本摘要自动生成,即使用计算机算法自动压缩文本内容,采用精炼的语言概括文本文档的中心思想,使读者通过阅读摘要即可了解原文表达的含义。文本摘要自动生成有两种方式:一是抽取式(Extractive),即从原文中找到关键句子并组合成摘要,如TextRank等;二是摘要式(Abstractive),即计算机读懂原文的内容并重新生成新句子组成摘要,如Seq2Seq等。目前相对成熟的是抽取式。Cardinaels等(2019)首次采用文本摘要生成法研究盈余公告及其对投资者估值的影响,为使用计算机研究投资者行为提供了思路;他们比较了机器生成的摘要和管理层披露的摘要在偏见和信息含量等特征上的差异,并分析了不同类型的摘要如何影响投资者对公司的估值。随后,越来越多的学者采用文本摘要自动生成法进行研究(Blaseg和Bannier,2019),并积极探索新的文本摘要自动生成技术(Hernandez-Castaneda等,2020)。

      • 文本主题提取,即抽取最能够体现文本内容主题的关键词,可用于提取年报、新闻、电话记录等文本的主题,通常采用LDA主题模型、TF-IDF模型、TextRank算法等技术手段。Campbell等(2014)首次将LDA模型应用于风险披露文本,通过从风险披露文本中提取风险因素,发现事前风险较高的公司会披露更多的风险因素,且风险披露信息显著影响事后的贝塔系数、股票回报波动率。Bao和Datta(2014)进一步提出了一种无监督的主题模型Sent-LDA,更精确地从风险披露文本中提取风险类型,并研究了风险类型对投资者风险感知的影响。Hanley和Hoberg(2019)结合LDA模型和Word2Vec技术,从银行年报中提取与风险相关的语义主题,发现在金融行业识别出的风险信号有助于监测金融风险。Brown等(2020)则使用LDA算法,提取财务报告的主题并研究其对错报的预测能力,发现文本、语言特征能够捕捉管理层操纵企业财务信息的行为。

      • 文本分类是指采用计算机对文档集按照一定的分类体系或标准进行自动分类与标记的方法。具体来说,即根据一个已经被标注的训练文档集,找到文档特征和文档类别之间的关系模型,然后利用这种学习得到的关系模型对新文档进行类别判断。文本分类方向包括二分类、多分类与多标签分类。文本分类方法可划分为传统机器学习方法(如朴素贝叶斯、支持向量机等)与深度学习方法(如FastText、TextCNN等)。Antweiler和Frank(2004)采用朴素贝叶斯与支持向量机算法将股吧留言划分为买入、持有、卖出三类。Larcker和Zakolyukina(2012)根据成熟的词典,统计各类词汇在CEO、CFO电话会议记录中的词频,然后训练二项逻辑回归模型来识别欺骗性管理层讨论。Frankel等(2016)应用支持向量回归算法,研究了MD&A的文本内容对当期应计项目的解释能力和对未来现金流的预测能力。Manela和Moreira(2017)选取《华尔街日报》的头版文章作为数据集,得到468091个维度向量,然后以期权隐含波动率作为被解释变量,采用支持向量机训练模型进行文本分类。Ryans(2021)运用朴素贝叶斯文本分类方法,将问询函划分为重述问询函和非重述问询函、减值问询函和非减值问询函。Bandiera等(2020)则通过机器学习算法将CEO划分为领导者和管理者,研究CEO行为与企业绩效的关系。

      • 文本数量能够用来刻画与指定主体相关的某类文档的累计数量,通常被研究者用来构造投资者关注度、媒体关注度等指数。在投资者关注度方面,Antweiler和Frank(2004)发现以股吧帖子数量衡量的投资者关注度指标能够有效预测股票收益率和市场波动情况。股票的搜索频率、百度指数以及位置搜索数等也被研究者用来衡量投资者关注度(Da等,2011俞庆进和张兵,2012Chi和Shanthikumar,2017)。在媒体关注度方面,饶育蕾等(2010)基于新闻条数构建媒体注意力指数,发现媒体注意力与股票月度收益率显著负相关。Hillert等(2014)也得到了类似结论。除上述两类指数外,Da等(2015)选择了30个最负面的词语作为特定搜索关键词以构建FEARS指数,曾建光(2015)根据“余额宝被盗”的百度搜索指数构建了投资者网络安全风险感知指标。

      • 非结构化的文本数据包含大量信息,针对以上文本来源,文本分析研究的文献运用文本挖掘方法提取文本特征,获得传统结构化数据以外的数据信息,同时探讨了这些文本特征与企业行为、股票市场行为等之间的关系。目前文本分析应用维度主要包括预测分析与因素分析两大类。

        文本信息能够用来预测市场反应。Antweiler和Frank(2004)研究表明股票留言板的信息并非噪音,而是与财务相关的信息,能够预测股票交易量和波动性。Das和Chen(2007)发现市场指数MSH与前一日的市场情绪显著相关。Loughran和McDonald(2011)构建了五个关于积极词汇、不确定性、诉讼、强势语调、弱势语调的词典,发现采用这些词典度量的语调与超额收益、交易量、回报波动率、未预期盈余等显著相关。马黎珺等(2019)研究发现前瞻性语句的情感积极程度与分析师报告发布后的投资者反应显著正相关。

        文本信息也能够用来预测公司财务舞弊。Loughran和McDonald(2011)构建了五个词典,发现采用这些词典度量的语调能够用来预测公司财务舞弊。Larcker和Zakolyukina(2012)发现管理层在电话会议中的语言特征可以用来识别财务错报。Brown等(2020)则研究财务报表的主题对公司财务错报的预测能力,发现年报的主题可用于预测财务错报。

        文本信息还可以用来预测公司价值与未来发展。Li(2008)发现归因类、积极类、将来时态类词汇使用情况与公司盈余可持续性相关。Li(2010)研究了公司年报MD&A中前瞻性声明(FLS)的信息内容,发现其能够预测公司未来盈利能力和股票流动性。饶育蕾等(2010)发现媒体关注度越高,公司下个月的平均收益率越低。Campbell等(2014)研究发现风险披露信息可用于预测事后的贝塔系数和股票回报波动率。Frankel等(2016)发现MD&A的文本内容对未来现金流具有预测能力。Manela和Moreira(2017)构建基于文本的指标(NVIX)以度量人们对不确定性的感知,并以此预测股票回报率。Renault(2017)研究发现交易日前半小时内投资者情绪的变化能够有效预测当天最后半小时的回报率。马黎珺等(2019)则证实前瞻性语句的情感积极程度与企业未来的收益增长、投资规模以及创新成果显著正相关。

        文本信息除可以用作预测分析,还可以进行因素分析,以探究不同股票市场现象、公司特征以及管理层行为等的影响因素。Li(2010)研究了公司年报MD&A中前瞻性声明(FLS)的信息内容,发现当期业绩较好、应计项目较少、规模较小、市净率较低、股票收益波动率较低、MD&A的迷雾指数较低、历史较长的企业,倾向于有较积极的FLS语调。Bao和Datta(2014)发现宏观经济风险、流动性风险与风险感知显著正相关,人力资源风险、规章变动风险、基础设施风险与风险感知显著负相关。Campbell等(2014)发现事前风险较高的公司会披露更多的风险因素,公司面临的风险类型决定了公司披露该风险的篇幅。Frankel等(2016)聚焦MD&A的文本内容,发现其对当期应计项目具有解释能力。Cardinaels等(2019)则将机器生成的摘要与管理层提供的摘要进行对比,发现管理层摘要的语调更为积极。

      • 为进一步考察国内文本分析研究现状,本文选取1994−2020年为时间窗口,以30本国家自然科学基金认定的管理学期刊以及21本财务与管理学期刊为文献来源,在中国知网中检索上述期刊中关键词包含“文本”的文献,并手工剔除学术研讨会综述、会议通知、征稿通知、消息、公示、期刊导读等非学术类文献以及隶属文学领域、检索系统方面等与文本分析研究无关的文献,最终获得318篇文本分析研究文献。本文统计的318篇文本分析研究文献主要包括两类:一是与文本分析技术相关的学术论文,二是与财务与会计领域文本分析应用相关的学术论文。

        1994−2020年国内文本分析研究文献年度分布如图3所示。国内期刊中,首篇文本分析研究论文发表于1994年。1994−2009年,国内重要期刊发表的文本分析研究论文每年不足10篇,此时文本分析研究没有引起关注,相关研究成果较少。2010年,文本分析研究发文量达到小高峰(10篇),其后至2013年,相关研究成果仍较少。2014年开始,文本分析研究发文量逐渐增多,每年超过10篇;2015年后,每年发文量达20余篇,且数量相对稳定。其后,发文量迅速增加,尤其从2019年开始,发文量超过50篇,2020年达到历史新高(63篇)。总体而言,近年来,国内文本分析研究发文量迅速增加,表明文本分析研究领域正受到国内学者越来越多的关注。

        图  3  国内文本分析研究文献年度分布

        1994−2020年,文本分析研究论文发表数量排名前五的中文期刊分别为《情报学报》《科学学与科学技术管理》《科学学研究》《系统工程理论与实践》和《科研管理》,具体各期刊的发文量如表1所示。

        表 1  国内文本分析研究文献的期刊分布

        期刊 发文量 期刊 发文量 期刊 发文量
        情报学报 86 中国工业经济 6 财贸经济 4
        科学学与科学技术管理 27 系统管理学报 6 农业经济问题 3
        科学学研究 24 系统工程 6 工业工程与管理 3
        系统工程理论与实践 16 管理评论 6 中国农村经济 2
        科研管理 15 公共管理学报 6 经济研究 2
        会计研究 13 金融研究 5 运筹与管理 1
        管理世界 13 管理工程学报 5 预测 1
        中国软科学 10 数理统计与管理 4 研究与发展管理 1
        中国管理科学 10 审计研究 4 系统工程学报 1
        管理学报 9 南开管理评论 4 世界经济 1
        统计研究 7 经济学动态 4 经济学(季刊) 1
        管理科学学报 7 管理科学 4 经济理论与经济管理 1
          注:未列出期刊的发文量均为0。本次统计对较早年份的文献进行了人工筛选,手动剔除了本文选定的中文期刊中与文本分析无关的文献;在《中国社会科学》《北京大学学报(哲学社会科学版)》《复旦学报(社会科学版)》《心理学报》《中国人民大学学报》五本期刊中,以“文本”为关键词查找到的文献均属于文学领域,与本研究无关,故进行了剔除处理;在《情报学报》中,1989−2002年的文献多为检索系统方面的研究,本文将此类文献排除在外;此外,《研究与发展管理》中有一篇文献与“超文本型组织”相关,《国际贸易问题》中有两篇以“文本”为关键词的文献并非真正意义上的文本分析,《统计研究》中有一篇文献属于统计科学研讨会会议纪要,一篇文献为期刊导读,故亦未将上述文献纳入统计范围。
      • 本文根据不同的文本信息来源,梳理了国内外文本分析文献的研究内容,主要包括社交网络类文本、上市公司披露类文本、媒体报道类文本以及其他类文本;介绍并总结了财务与会计领域主要使用的文本分析技术,包括主题分析、词典法、词袋法、监督学习、无监督学习和自然语言处理。本文将文献按照文本特征提取维度分别进行归纳,包括文本情绪、文本可读性、文本相似度、文本摘要、文本主题、文本分类以及文本数量七种文本特征;还总结了文本分析应用研究的角度,并将之分为预测分析与因素分析两大类。最后,本文回顾了国内文本分析研究现状,从期刊分布与年度分布两个角度展开分析。本文针对文本分析研究的文献特征与研究进展进行系统介绍,有助于国内研究者了解文本分析技术及其相关应用主题,引起更多学者关注和从事财务与会计领域的文本分析研究。

        本文认为,未来财务与会计领域文本分析研究可以从以下几个方面进一步深入探讨:首先,开拓更丰富的文本信息来源,如公司招聘公告、业绩预告、日常经营公告、风险提示公告、公司债券预案、微信推送、政府工作报告、国务院政策文件、法院裁判文书等。其次,更多地运用自然语言处理技术进行文本分析。如今,深度学习方法在自然语言处理领域已迅猛发展(如XLNet、BERT等),不仅能挖掘丰富的研究内容与研究对象,还能提高文本信息提取的效率与准确性。再次,优化已有的文本信息特征指标,如构建更适合中国情境的情绪词典,采用深度学习法改进文本摘要自动生成方式与文本可读性衡量指标等;同时挖掘与探讨更多的文本信息特征,如文本逻辑、文本可视化、文本复杂度等;拓展财务与会计领域研究的视角,发现更多适合文本分析研究的主题,如分析师行为、公司并购、审计质量等。最后,提高研究的可复制性。将文本信息转化为结构化数据的过程相对比较复杂,指标、技术的选取对研究结果具有较大的影响。因此,研究者应针对文档的预处理、特征提取方式、词典选择以及算法细节等进行详细记录。

    注释:
    ①  如办公文档、文本、图片、XML、HTML、各类报表、图像和音视频。
    ②  希捷科技与国际数据公司(IDC)研究表明,到2025年,全球数据量将从2016年的16ZB上升至163ZB。著名研究机构Garter也表示,全球信息量正在以59%以上的年增长率快速增长。在这些数据中,结构化数据仅占全部数据量的20%,其余80%均是以文件形式存在的非结构化数据,而日志文件、机器数据等又占非结构化数据的90%。
    ③  如金融行业的“双录”资料,医疗行业的影像资料,教育行业的教学文档,传媒行业的音视频素材,税务工商、社保等各类业务办理机构的影像资料,公安执法的视频存档等。
    ④  隐含狄利克雷分布(Latent Dirichlet Allocation,LDA)主题模型,多用于文档主题提取。
    ⑤  美国最大的投资类社交媒体网站之一。
    ⑥  专注于金融市场的社交投资平台。
    ⑦  《今日美国》《迈阿密先驱报》《芝加哥论坛报》《华盛顿邮报》《洛杉矶时报》《波士顿环球报》《旧金山纪事报》《达拉斯晨报》《纽约时报》《华尔街日报》。
    ⑧  《上海证券报》《中国证券报》《证券时报》《金融时报》《经济日报》《中国改革报》《中国日报》《证券市场周刊》。
    ⑨  《中国证券报》《证券日报》《证券时报》《上海证券报》《中国经营报》《21世纪经济报道》《经济观察报》《第一财经日报》。
    ⑩  《北京青年报》《广州日报》《解放日报》《人民日报海外版》《新闻晨报》《南方都市报》《新京报》《今日晚报》《文汇报》《羊城晚报》。
    ⑪  《审计研究》《中国会计评论》《财贸经济》《经济理论与经济管理》《经济研究》《中国社会科学》《世界经济》《经济学动态》《北京大学学报(哲学社会科学版)》《复旦学报(社会科学版)》《国际贸易问题》《心理学报》《中国人民大学学报》《新华文摘》《系统管理学报》《统计研究》《产业经济评论》《经济学(季刊)》《营销科学学报》《中国会计与财务研究》《会计与经济研究》。
    参考文献 (110)

    目录

      /

      返回文章
      返回