В настоящее время я работаю над проектом, в котором один скрипт PHP получает файл индекса из ftp://ftp.sec.gov и помещает всю информацию о компании в базу данных. Затем второй скрипт PHP извлекает необработанный текстовый файл из SEC и сохраняет его локально для обработки.
Пример необработанного текстового файла можно найти здесь —
ftp://ftp.sec.gov/edgar/data/2488/0000002488-15-000028.txt
Пример того, каким должен быть конечный результат, можно найти здесь —
http://www.sec.gov/Archives/edgar/data/1084869/000143774915020024/flws20150927_10q.htm
Цель состоит в том, чтобы иметь возможность представлять подачу в отформатированном виде, как это делают многие компании, но проблема в том, что я не могу понять, как это делается надежно для каждой подачи. Кажется, что некоторые заявки содержат XML, а другие — HTML
Как я смогу надежно создать отформатированную версию необработанных текстовых файлов?
Текущий код у меня есть —
$db_hostname = "localhost";
$db_username = "username";
$db_password = "password";
$db_database = "database";
$db_server = mysql_connect($db_hostname, $db_username, $db_password);
if (!$db_server) die("Unable to connect to MySQL: " . mysql_error());
mysql_select_db($db_database)
or die("Unable to select database: " . mysql_error());
$query = "SELECT * FROM company WHERE company = '1 800 FLOWERS COM INC' AND date = '2015-08-06'";
$result = mysql_query($query);
$row = mysql_fetch_row($result);
$file = "ftp://ftp.sec.gov/" . $row[4];
$text = file_get_contents($file);
if($text === false){
echo "error downloading file $row[4]\n";
continue;
}
$tarray = explode('<SEQUENCE>', $text);
for($i = 1; $i < count($tarray); $i++){
$a = strstr($tarray[$i], '<HTML>');
if($a == false)continue; //means that there is no html document in this sequence
$html = strstr($a, '</HTML>', true);
$html.="</HTML>";
$running = $running . $html;
}
$temp = "cache.htm";
file_put_contents($temp, $running);
$name = $row[0] . "-" . $row[3] . ".pdf";
$name = str_replace(' ', '_', $name);
//$content = file_get_contents($row[2] . "-" . $row[1] . ".htm");
exec("D://wkhtmltopdf/bin/wkhtmltopdf.exe $temp $name");
unlink($temp);
//echo($row[0] . " created");
?>
Вам не нужно использовать необработанные текстовые файлы. Ты можешь использовать sec-api
(https://www.npmjs.com/package/sec-api). Пакет предоставляет канал в реальном времени для sec.gov EDGAR с использованием веб-сокетов — он работает на стороне клиента (React, React Native, Angular, Vue и т. Д.) И на стороне сервера (Node.js и т. Д.) JavaScript.
Как только в EDGAR публикуется новая заявка (10K, 10Q, 13D и т. Д.), Пакет запускает событие и возвращает следующие данные в формате JSON:
{
"companyName":"MORGAN STANLEY (0000895421) (Filer)",
"type":"424B2",
"description":"FORM 424B2",
"linkToFilingDetails":"https://www.sec.gov/...014988-index.htm",
"linkToHtmlAnnouncement":"https://www.sec.gov/...268.htm",
"announcedAt":"2018-12-26T16:02:32-05:00"}
linkToFilingDetails
указывает на файл HTML, в котором перечислены все вложения подачи.
linkToHtmlAnnouncement
указывает на HTML-файл самой подачи.
PHP в сочетании с плагинами, поддерживающими websockets (например, Ratchet) также могут быть использованы.
Других решений пока нет …